netzstrategen
Consulting denken & planen Übersicht
KI-Strategie & Game Plan Übersicht MarktpotenzialanalyseWettbewerbsanalyseBusiness AuditZielgruppen & PersonasCustomer JourneysOrganisationsberatung
Brand & Design Übersicht MarkenpositionierungCorporate & Visual DesignCorporate & Digital LanguageUser Experience & UI DesignInformation Architecture
Marketing & Sales Übersicht SEOSEAGEOGEASocial Media AdsE-Mail-MarketingMarketing Automation & CRM
Content & Communication Übersicht Content-StrategieContent Audit & ReviewContent-ErstellungCommunication GuidelinesBrandvoicePR & ReputationsmanagementSocial Media StrategieBarrierefreie Kommunikation
Technology & Data Übersicht TechnologieanalyseAnforderungsentwicklungDatenstrategieImplementierung & IntegrationDatenanalyse
Implementation bauen & einführen Übersicht
Web- & Daten-Infrastruktur Übersicht Websites & Landing PagesWebshops & Web-KatalogeData & Reporting
KI-Schulung & Enablement Übersicht Schulungen & TrainingsAI-Lernprogramme
Marketing-Betrieb & Automation Übersicht Search AdsSocial AdsSEO- & GEO-BetreuungNewsletterContent-Betrieb
AI Operations betreiben & weiterentwickeln Übersicht
KI-Plattform Übersicht Strategy LayerOperations LayerOutput LayerAdmin Layer
KI-Verordnung & DSGVO Übersicht EU-Hosting & AnonymisierungAuditierbarkeit & DokumentationLeitplanken gegen Halluzinationen
KI-Agenten & Studios Übersicht Content StudioSEO StudioMarketing StudioData StudioSales StudioService Studio
ReferenzenInsightsProfile English Diagnose Call
Technologie

Eigenes LLM betreiben: Was es kostet, was es braucht und wann es sich lohnt

Veröffentlicht am 13.8.2026 · André Hellmann

„Wir betreiben unser eigenes LLM” klingt nach Unabhängigkeit. Technisch ist der Einstieg heute einfach: ein Rechner mit ausreichend Grafikspeicher, ein Werkzeug wie Ollama, dreißig Minuten Zeit. Die schwierige Frage kommt danach. Wer ein eigenes LLM betreiben will, kauft nicht nur Rechenleistung, sondern eine Betriebsaufgabe. Dieser Beitrag rechnet nach, was das kostet und wann es sich lohnt.

Standortbestimmung

Den nächsten Schritt im kostenlosen Diagnose-Call besprechen. Termin buchen →

Inhalt

Was Self-Hosting bei LLMs wirklich bedeutet

Selbst gehostete AI heißt: Das Modell läuft auf Hardware, über die das Unternehmen verfügt. Keine Anfrage verlässt die eigene Infrastruktur. Das ist der eine Teil.

Der andere Teil ist Betrieb. Ein LLM selbst zu hosten bedeutet, dauerhaft Verantwortung zu übernehmen, für Verfügbarkeit, Aktualisierung, Zugriffsrechte, Protokollierung und Sicherheit. Ein Modell zu starten dauert Minuten. Es produktiv zu halten, ist eine laufende Aufgabe.

Drei Dinge werden dabei regelmäßig unterschätzt. Erstens die Auslastung: Eine GPU kostet gleich viel, ob sie rechnet oder wartet. Zweitens das Tempo: Offene Modelle erscheinen im Wochenrhythmus, jede Aktualisierung will getestet werden. Drittens die Oberfläche: ein API-Endpunkt allein ist kein Arbeitswerkzeug für Mitarbeitende.

Wo ein Unternehmen bei AI heute steht, lässt sich in wenigen Minuten einordnen: über den kostenlosen Self-Check.

Hardware: Wie viel GPU ein Modell braucht

Die entscheidende Größe ist der Grafikspeicher, kurz VRAM. Eine belastbare Faustformel: Parameterzahl mal Bits pro Gewicht, geteilt durch acht, ergibt den Speicherbedarf in Gigabyte. Ein Modell mit 8 Milliarden Parametern in 4-Bit-Quantisierung braucht also grob 4 GB, plus Reserve für Kontext und Zwischenspeicher.

In der Praxis ergeben sich vier Klassen:

  • 8–12 GB VRAM: Modelle mit 7–8 Milliarden Parametern, quantisiert. Genug für Textaufgaben, Zusammenfassungen, einfache Klassifikation.
  • 24 GB VRAM: Modelle bis rund 30 Milliarden Parameter, quantisiert. Deutlich bessere Qualität, spürbar mehr Kontext.
  • 48 GB VRAM: 70-Milliarden-Modelle in Quantisierung oder mehrere kleinere Modelle parallel.
  • 80–96 GB VRAM: Produktivbetrieb mit großen Modellen und mehreren gleichzeitigen Nutzenden.

Quantisierung ist dabei der wichtigste Faktor. Sie reduziert die Genauigkeit der Modellgewichte und damit den Speicherbedarf, bei moderatem Qualitätsverlust. Ein 70B-Modell, das in voller Präzision zwei Spezial-GPUs belegt, läuft quantisiert auf einer.

Wichtig ist der Unterschied zwischen „läuft” und „trägt”. Ein Modell auf dem Laptop antwortet für eine Person. Fünfzig gleichzeitige Anfragen sind eine andere Aufgabe. Dafür zählt nicht nur VRAM, sondern Durchsatz, die eigentliche Disziplin der LLM-Inferenz.

Die Frage ist nie, ob ein Modell läuft. Die Frage ist, ob der Betrieb trägt.

Europäische Alternativen zur eigenen Hardware

Wer keine Hardware kaufen will, mietet sie. Europäische Anbieter machen das ohne Umweg über US-Rechenzentren möglich, ein praktischer Baustein für digitale Souveränität.

Hetzner bietet mit dem GEX131 einen dedizierten GPU-Server mit 96 GB Grafikspeicher ab 889 € pro Monat, ohne Einrichtungsgebühr und in ISO-27001-zertifizierten Rechenzentren in Deutschland und Finnland (Quelle: Hetzner, 2025). OVHcloud stellt GPU-Instanzen stundenweise bereit, eine L40S mit 48 GB liegt bei rund 1,40 € pro Stunde (Quelle: OVHcloud Public Cloud GPU, 2026), rechnerisch gut 1.000 € im Dauerbetrieb, aber günstig für zeitlich begrenzte Lasten.

Die drei realistischen Ausbaustufen im Überblick:

SzenarioHardware / CloudSetup-AufwandMonatliche KostenGeeignet für
KleinVorhandene Workstation, 12–24 GB VRAM, Ollama½–1 TagStrom und Wartung, keine LizenzkostenTests, Prototypen, einzelne Fachbereiche
MittelDedizierter GPU-Server, 96 GB VRAM (z. B. Hetzner GEX131)2–5 Tageab 889 €konstante interne Last, sensible Daten
GroßMehrere GPU-Server oder Cloud-GPUs mit Redundanzmehrere Wochenab rund 2.000 € plus Betreuunghohe Last, Ausfallsicherheit, SLA

Nicht in der Tabelle steht der größte Posten: die Zeit der eigenen Leute. Einrichtung, Absicherung, Monitoring und Aktualisierung binden Kapazität, dauerhaft, nicht einmalig.

Werkzeuge: Ollama, Open WebUI und vLLM

Drei Werkzeuge decken fast alle Fälle ab. Sie lösen unterschiedliche Probleme und ergänzen sich.

WerkzeugAufgabeStärkeGrenze
OllamaModelle lokal laden und ausführenschnellster Einstieg, sehr einfache Bedienungauf Durchsatz für viele Nutzende nicht ausgelegt
Open WebUIChat-Oberfläche mit Nutzerverwaltungmacht das Modell für Mitarbeitende nutzbarersetzt keine Governance
vLLMHochleistungs-Inferenzserverhoher Durchsatz bei parallelen Anfragenmehr Einrichtungs- und Betriebsaufwand

Der typische Weg: Ollama für den Machbarkeitsnachweis, Open WebUI als Arbeitsoberfläche, vLLM sobald mehrere Teams gleichzeitig zugreifen. Alle drei sprechen eine OpenAI-kompatible Schnittstelle. Ein Wechsel des Servers zwingt also nicht zum Umbau der Anwendungen, genau das reduziert Abhängigkeit.

Welche Modelle überhaupt infrage kommen, ordnet der Überblick zu Open Source LLMs ein.

Die Kostenrechnung: Self-Hosted gegen API

Jetzt die Zahlen. Ein GPU-Server kostet einen festen Betrag pro Monat, unabhängig von der Nutzung. Eine API kostet pro Token: wenig bei kleinem Volumen, viel bei großem. Irgendwo schneiden sich beide Linien.

Die Rechnung mit belegten Preisen: Ein dedizierter GPU-Server liegt bei 889 € im Monat (Quelle: Hetzner, 2025). Eine Frontier-API wie Claude Sonnet kostet 2 $ je Million Eingabe- und 10 $ je Million Ausgabe-Tokens (Quelle: Anthropic, 2026), bei einem Verhältnis von drei zu eins rund 4 $ je Million Tokens gemischt. Eine gehostete Open-Model-API liegt deutlich darunter: Qwen3 235B kostet bei Together AI 0,20 $ Eingabe und 0,60 $ Ausgabe je Million Tokens (Quelle: Together AI, 2026), gemischt rund 0,30 $.

Ab wann sich der eigene Server rechnet Monatskosten nach Token-Volumen, Modellrechnung 1.600 € 889 € 0 € Break-even ≈ 222 Mio. Tokens 0 200 Mio. 400 Mio. Tokens pro Monat GPU-Server (889 €/Monat) Frontier-API (≈ 4 €/Mio.) Open-Model-API (≈ 0,30 €/Mio.) Illustrativ · Modellrechnung netzstrategen; Preise: Hetzner 2025, Anthropic 2026, Together AI 2026 netzstrategen
Gegen eine Frontier-API rechnet sich der eigene GPU-Server ab rund 222 Millionen Tokens im Monat. Gegen eine gehostete Open-Model-API rechnet er sich in dieser Rechnung nie. Dollar-Preise sind zur Vereinfachung eins zu eins in Euro angesetzt.
Für Präsentationen:

Das Ergebnis ist unbequem. Der Break-even gegenüber der Frontier-API liegt bei rund 222 Millionen Tokens pro Monat, etwa 7,4 Millionen Tokens am Tag oder grob 3.700 umfangreiche Anfragen täglich. Das erreichen wenige Mittelständler. Gegen eine gehostete Open-Model-API rechnet sich der eigene Server praktisch nie, weil die Anbieter ihre GPUs über viele Kunden auslasten.

Nicht eingerechnet sind Betriebsaufwand, Bereitschaft und Ausfallsicherheit. Wer diese Posten ehrlich ansetzt, verschiebt den Break-even weiter nach rechts. Wie sich Token-Kosten grundsätzlich senken lassen, zeigt der Beitrag zu token-smarter Architektur.

Die Konsequenz: Self-Hosting ist selten eine Kostenentscheidung. Es ist eine Kontrollentscheidung.

Fazit: Drei Fragen vor der Entscheidung

Drei Fragen führen zu einer belastbaren Antwort.

  1. Müssen die Daten im Haus bleiben? Wenn ja, aus rechtlichen oder vertraglichen Gründen, ist Self-Hosting oft alternativlos, unabhängig vom Preis.
  2. Ist die Last hoch und gleichmäßig? Nur dann trägt die feste Monatsgebühr. Schwankende Nutzung spricht klar für eine API.
  3. Gibt es Menschen für den Betrieb? Ohne benannte Verantwortung und Zeitbudget wird aus dem eigenen Server ein Projekt ohne Betreuung.

Zwei Mal Ja bei Frage 1 und 3 genügt meist. Nur Frage 2 allein trägt die Entscheidung nicht.

Der pragmatische Weg beginnt klein: ein offenes Modell auf vorhandener Hardware, ein klar umrissener Anwendungsfall, gemessene Nutzung über drei Monate. Danach steht die Rechnung auf Daten statt auf Annahmen. Genau so gehört die Frage in einen dauerhaften AI-Betrieb, als Teil von AI Operations, nicht als Einzelentscheidung.

Häufige Fragen zum eigenen LLM

Was kostet es, ein eigenes LLM zu betreiben?

Für erste Tests auf vorhandener Hardware entstehen kaum Kosten außer Strom und Zeit. Ein dedizierter GPU-Server mit 96 GB Grafikspeicher beginnt bei 889 € pro Monat (Quelle: Hetzner, 2025). Dazu kommt der Betriebsaufwand im eigenen Team, der in fast jeder Rechnung fehlt.

Welche Hardware braucht ein LLM mindestens?

Für quantisierte Modelle mit 7 bis 8 Milliarden Parametern genügen 8 bis 12 GB VRAM. Für 70-Milliarden-Modelle in Quantisierung sind rund 48 GB nötig. Der Speicherbedarf ergibt sich näherungsweise aus Parameterzahl mal Bits pro Gewicht geteilt durch acht.

Ist Ollama für den produktiven Einsatz geeignet?

Für einzelne Nutzende und Prototypen ja. Bei vielen parallelen Anfragen stößt Ollama an Grenzen. Dann ist vLLM die passende Wahl. Beide bieten eine OpenAI-kompatible Schnittstelle, der Wechsel ist deshalb überschaubar.

Ist Self-Hosting günstiger als eine API?

In den meisten Fällen nicht. Der Break-even gegenüber einer Frontier-API liegt bei rund 222 Millionen Tokens im Monat, gegenüber günstigen Open-Model-APIs meist gar nicht. Der Grund für Self-Hosting ist Datenkontrolle, nicht der Preis.

Wie lässt sich die Entscheidung sauber vorbereiten?

Mit einer Messung statt einer Schätzung: tatsächliches Token-Volumen, Datenschutzanforderungen und verfügbare Betriebskapazität. Wir ordnen das im kostenlosen Diagnose-Call ein.

Quellen

André Hellmann

Autor & redaktionelle Verantwortung

André Hellmann

Gründer & Geschäftsführer

Gründer und Geschäftsführer der netzstrategen GmbH, seit 2006 an Bord. Sein Fokus: Datenmessung, Analytik und Strategiedefinition. Heute vor allem der Aufbau von AI Operations, von der Strategie bis zum laufenden Betrieb. Branchenerfahrung in Pharma, Automobil und Fertigungsindustrie.

Profil & alle Beiträge Termin vereinbaren LinkedIn

So ist dieser Beitrag entstanden

Mensch
  • Themenwahl
  • Quellenwahl
  • Faktenprüfung
  • Freigabe
AI
  • Recherche
  • Textentwurf
  • Schaubilder
  • Publishing

Dieser Beitrag entstand mit AI-Unterstützung. Ideenfindung, Redaktionsplanung, inhaltliche Prüfung und Freigabe liegen beim Menschen, das Lektorat bei der AI. Die redaktionelle Verantwortung trägt André Hellmann.

So entstehen unsere Inhalte →

So geht es weiter

Self-Check

AI-Potenzial einschätzen

In 5 Minuten: konkrete Einschätzung, wo das Unternehmen bei AI steht.

Self-Check starten →
Newsletter

Digital Impact direkt ins Postfach

Eine Anmeldung, drei Newsletter: der AI Insights Newsletter jede Woche mit den neuesten Insights-Artikeln, der Digital Impact Longread Newsletter und das Digital Impact Update je einmal im Monat. Mit Double Opt-in und jederzeit abbestellbar.

Podcast

AI Operations zum Hören

Digital-Experten wie André Hellmann, Christina D'Ilio, Christian Sattel, Sarah Stock sowie regelmäßig Gäste aus der Praxis: alle Themen rund um AI Operations als Audio für unterwegs.