LLM-Inferenz
Auch bekannt als: Inferenz, Inference, Model Serving
LLM-Inferenz bezeichnet den Moment, in dem ein trainiertes Sprachmodell tatsächlich arbeitet: Es erhält eine Anfrage und erzeugt eine Antwort, Token für Token. Jede Chat-Antwort ist Inferenz.
Training vs. Inferenz
Training ist das Studium, Inferenz der Berufsalltag. Das Training passiert einmal und kostet Millionen. Inferenz passiert bei jeder einzelnen Anfrage, millionenfach am Tag. Deshalb bestimmt die Inferenz die laufenden Kosten im AI-Betrieb.
Wie Kosten gemessen werden
Anbieter rechnen pro Token ab, getrennt nach Input (die Anfrage) und Output (die Antwort). Output-Token kosten meist deutlich mehr. Wer Kosten plant, schätzt beides: Lange Antworten wiegen schwerer als lange Prompts.
Was die Geschwindigkeit bestimmt
Drei Faktoren entscheiden. Erstens die Modellgröße: Mehr Parameter bedeuten mehr Rechenarbeit pro Token. Zweitens die Hardware: GPUs sind Standard, Spezialchips wie LPUs beschleunigen deutlich. Drittens das Batching: Viele Anfragen parallel erhöhen den Durchsatz, können einzelne Antworten aber verzögern.
Cloud oder selbst betreiben
Hyperscaler wie AWS Bedrock, Azure AI Foundry und Google Vertex AI hosten viele Modelle. Spezialisten wie Groq, Cerebras, Together AI und Fireworks AI konkurrieren über Tempo und Preis. Die Alternative: Self-hosted AI auf eigener Hardware: ohne Token-Abrechnung, dafür mit Betriebsaufwand.
Den nächsten Schritt im kostenlosen Diagnose-Call besprechen. Termin buchen →
Stand: Juni 2026
Claude Cheat Sheet
Alle Claude-Features, Modelle und Praxis-Tipps kompakt auf einen Blick. Bilingual (DE/EN), laufend aktualisiert von netzstrategen.
Jetzt öffnenDigital Impact direkt ins Postfach
Eine Anmeldung, drei Newsletter: der AI Insights Newsletter jede Woche mit den neuesten Insights-Artikeln, der Digital Impact Longread Newsletter und das Digital Impact Update je einmal im Monat. Mit Double Opt-in und jederzeit abbestellbar.
AI Operations zum Hören
Digital-Experten wie André Hellmann, Christina D'Ilio, Christian Sattel, Sarah Stock sowie regelmäßig Gäste aus der Praxis: alle Themen rund um AI Operations als Audio für unterwegs.
So ist dieser Beitrag entstanden
- Themenwahl
- Quellenwahl
- Faktenprüfung
- Freigabe
- Recherche
- Textentwurf
- Schaubilder
- Publishing
Dieser Beitrag entstand mit AI-Unterstützung. Ideenfindung, Redaktionsplanung, inhaltliche Prüfung und Freigabe liegen beim Menschen, das Lektorat bei der AI. Die redaktionelle Verantwortung trägt André Hellmann.