netzstrategen
Consulting denken & planen Übersicht
KI-Strategie & Game Plan Übersicht MarktpotenzialanalyseWettbewerbsanalyseBusiness AuditZielgruppen & PersonasCustomer JourneysOrganisationsberatung
Brand & Design Übersicht MarkenpositionierungCorporate & Visual DesignCorporate & Digital LanguageUser Experience & UI DesignInformation Architecture
Marketing & Sales Übersicht SEOSEAGEOGEASocial Media AdsE-Mail-MarketingMarketing Automation & CRM
Content & Communication Übersicht Content-StrategieContent Audit & ReviewContent-ErstellungCommunication GuidelinesBrandvoicePR & ReputationsmanagementSocial Media StrategieBarrierefreie Kommunikation
Technology & Data Übersicht TechnologieanalyseAnforderungsentwicklungDatenstrategieImplementierung & IntegrationDatenanalyse
Implementation bauen & einführen Übersicht
Web- & Daten-Infrastruktur Übersicht Websites & Landing PagesWebshops & Web-KatalogeData & Reporting
KI-Schulung & Enablement Übersicht Schulungen & TrainingsAI-Lernprogramme
Marketing-Betrieb & Automation Übersicht Search AdsSocial AdsSEO- & GEO-BetreuungNewsletterContent-Betrieb
AI Operations betreiben & weiterentwickeln Übersicht
KI-Plattform Übersicht Strategy LayerOperations LayerOutput LayerAdmin Layer
KI-Verordnung & DSGVO Übersicht EU-Hosting & AnonymisierungAuditierbarkeit & DokumentationLeitplanken gegen Halluzinationen
KI-Agenten & Studios Übersicht Content StudioSEO StudioMarketing StudioData StudioSales StudioService Studio
ReferenzenInsightsProfile English Diagnose Call
Tools & Regulierung

LLM-Inferenz

Auch bekannt als: Inferenz, Inference, Model Serving

LLM-Inferenz bezeichnet den Moment, in dem ein trainiertes Sprachmodell tatsächlich arbeitet: Es erhält eine Anfrage und erzeugt eine Antwort, Token für Token. Jede Chat-Antwort ist Inferenz.

Training vs. Inferenz

Training ist das Studium, Inferenz der Berufsalltag. Das Training passiert einmal und kostet Millionen. Inferenz passiert bei jeder einzelnen Anfrage, millionenfach am Tag. Deshalb bestimmt die Inferenz die laufenden Kosten im AI-Betrieb.

Wie Kosten gemessen werden

Anbieter rechnen pro Token ab, getrennt nach Input (die Anfrage) und Output (die Antwort). Output-Token kosten meist deutlich mehr. Wer Kosten plant, schätzt beides: Lange Antworten wiegen schwerer als lange Prompts.

Was die Geschwindigkeit bestimmt

Drei Faktoren entscheiden. Erstens die Modellgröße: Mehr Parameter bedeuten mehr Rechenarbeit pro Token. Zweitens die Hardware: GPUs sind Standard, Spezialchips wie LPUs beschleunigen deutlich. Drittens das Batching: Viele Anfragen parallel erhöhen den Durchsatz, können einzelne Antworten aber verzögern.

Cloud oder selbst betreiben

Hyperscaler wie AWS Bedrock, Azure AI Foundry und Google Vertex AI hosten viele Modelle. Spezialisten wie Groq, Cerebras, Together AI und Fireworks AI konkurrieren über Tempo und Preis. Die Alternative: Self-hosted AI auf eigener Hardware: ohne Token-Abrechnung, dafür mit Betriebsaufwand.

Standortbestimmung

Den nächsten Schritt im kostenlosen Diagnose-Call besprechen. Termin buchen →

Stand: Juni 2026

Kostenlos & aktuell

Claude Cheat Sheet

Alle Claude-Features, Modelle und Praxis-Tipps kompakt auf einen Blick. Bilingual (DE/EN), laufend aktualisiert von netzstrategen.

Jetzt öffnen
Newsletter

Digital Impact direkt ins Postfach

Eine Anmeldung, drei Newsletter: der AI Insights Newsletter jede Woche mit den neuesten Insights-Artikeln, der Digital Impact Longread Newsletter und das Digital Impact Update je einmal im Monat. Mit Double Opt-in und jederzeit abbestellbar.

Podcast

AI Operations zum Hören

Digital-Experten wie André Hellmann, Christina D'Ilio, Christian Sattel, Sarah Stock sowie regelmäßig Gäste aus der Praxis: alle Themen rund um AI Operations als Audio für unterwegs.

So ist dieser Beitrag entstanden

Mensch
  • Themenwahl
  • Quellenwahl
  • Faktenprüfung
  • Freigabe
AI
  • Recherche
  • Textentwurf
  • Schaubilder
  • Publishing

Dieser Beitrag entstand mit AI-Unterstützung. Ideenfindung, Redaktionsplanung, inhaltliche Prüfung und Freigabe liegen beim Menschen, das Lektorat bei der AI. Die redaktionelle Verantwortung trägt André Hellmann.

So entstehen unsere Inhalte →

Verwandte Begriffe