Eigenes LLM betreiben: Was es kostet, was es braucht und wann es sich lohnt
Veröffentlicht am 13.8.2026 · André Hellmann
„Wir betreiben unser eigenes LLM” klingt nach Unabhängigkeit. Technisch ist der Einstieg heute einfach: ein Rechner mit ausreichend Grafikspeicher, ein Werkzeug wie Ollama, dreißig Minuten Zeit. Die schwierige Frage kommt danach. Wer ein eigenes LLM betreiben will, kauft nicht nur Rechenleistung, sondern eine Betriebsaufgabe. Dieser Beitrag rechnet nach, was das kostet und wann es sich lohnt.
Den nächsten Schritt im kostenlosen Diagnose-Call besprechen. Termin buchen →
Inhalt
- Was Self-Hosting bei LLMs wirklich bedeutet
- Hardware: Wie viel GPU ein Modell braucht
- Europäische Alternativen zur eigenen Hardware
- Werkzeuge: Ollama, Open WebUI und vLLM
- Die Kostenrechnung: Self-Hosted gegen API
- Fazit: Drei Fragen vor der Entscheidung
- Häufige Fragen zum eigenen LLM
- Quellen
Was Self-Hosting bei LLMs wirklich bedeutet
Selbst gehostete AI heißt: Das Modell läuft auf Hardware, über die das Unternehmen verfügt. Keine Anfrage verlässt die eigene Infrastruktur. Das ist der eine Teil.
Der andere Teil ist Betrieb. Ein LLM selbst zu hosten bedeutet, dauerhaft Verantwortung zu übernehmen, für Verfügbarkeit, Aktualisierung, Zugriffsrechte, Protokollierung und Sicherheit. Ein Modell zu starten dauert Minuten. Es produktiv zu halten, ist eine laufende Aufgabe.
Drei Dinge werden dabei regelmäßig unterschätzt. Erstens die Auslastung: Eine GPU kostet gleich viel, ob sie rechnet oder wartet. Zweitens das Tempo: Offene Modelle erscheinen im Wochenrhythmus, jede Aktualisierung will getestet werden. Drittens die Oberfläche: ein API-Endpunkt allein ist kein Arbeitswerkzeug für Mitarbeitende.
Wo ein Unternehmen bei AI heute steht, lässt sich in wenigen Minuten einordnen: über den kostenlosen Self-Check.
Hardware: Wie viel GPU ein Modell braucht
Die entscheidende Größe ist der Grafikspeicher, kurz VRAM. Eine belastbare Faustformel: Parameterzahl mal Bits pro Gewicht, geteilt durch acht, ergibt den Speicherbedarf in Gigabyte. Ein Modell mit 8 Milliarden Parametern in 4-Bit-Quantisierung braucht also grob 4 GB, plus Reserve für Kontext und Zwischenspeicher.
In der Praxis ergeben sich vier Klassen:
- 8–12 GB VRAM: Modelle mit 7–8 Milliarden Parametern, quantisiert. Genug für Textaufgaben, Zusammenfassungen, einfache Klassifikation.
- 24 GB VRAM: Modelle bis rund 30 Milliarden Parameter, quantisiert. Deutlich bessere Qualität, spürbar mehr Kontext.
- 48 GB VRAM: 70-Milliarden-Modelle in Quantisierung oder mehrere kleinere Modelle parallel.
- 80–96 GB VRAM: Produktivbetrieb mit großen Modellen und mehreren gleichzeitigen Nutzenden.
Quantisierung ist dabei der wichtigste Faktor. Sie reduziert die Genauigkeit der Modellgewichte und damit den Speicherbedarf, bei moderatem Qualitätsverlust. Ein 70B-Modell, das in voller Präzision zwei Spezial-GPUs belegt, läuft quantisiert auf einer.
Wichtig ist der Unterschied zwischen „läuft” und „trägt”. Ein Modell auf dem Laptop antwortet für eine Person. Fünfzig gleichzeitige Anfragen sind eine andere Aufgabe. Dafür zählt nicht nur VRAM, sondern Durchsatz, die eigentliche Disziplin der LLM-Inferenz.
Die Frage ist nie, ob ein Modell läuft. Die Frage ist, ob der Betrieb trägt.
Europäische Alternativen zur eigenen Hardware
Wer keine Hardware kaufen will, mietet sie. Europäische Anbieter machen das ohne Umweg über US-Rechenzentren möglich, ein praktischer Baustein für digitale Souveränität.
Hetzner bietet mit dem GEX131 einen dedizierten GPU-Server mit 96 GB Grafikspeicher ab 889 € pro Monat, ohne Einrichtungsgebühr und in ISO-27001-zertifizierten Rechenzentren in Deutschland und Finnland (Quelle: Hetzner, 2025). OVHcloud stellt GPU-Instanzen stundenweise bereit, eine L40S mit 48 GB liegt bei rund 1,40 € pro Stunde (Quelle: OVHcloud Public Cloud GPU, 2026), rechnerisch gut 1.000 € im Dauerbetrieb, aber günstig für zeitlich begrenzte Lasten.
Die drei realistischen Ausbaustufen im Überblick:
| Szenario | Hardware / Cloud | Setup-Aufwand | Monatliche Kosten | Geeignet für |
|---|---|---|---|---|
| Klein | Vorhandene Workstation, 12–24 GB VRAM, Ollama | ½–1 Tag | Strom und Wartung, keine Lizenzkosten | Tests, Prototypen, einzelne Fachbereiche |
| Mittel | Dedizierter GPU-Server, 96 GB VRAM (z. B. Hetzner GEX131) | 2–5 Tage | ab 889 € | konstante interne Last, sensible Daten |
| Groß | Mehrere GPU-Server oder Cloud-GPUs mit Redundanz | mehrere Wochen | ab rund 2.000 € plus Betreuung | hohe Last, Ausfallsicherheit, SLA |
Nicht in der Tabelle steht der größte Posten: die Zeit der eigenen Leute. Einrichtung, Absicherung, Monitoring und Aktualisierung binden Kapazität, dauerhaft, nicht einmalig.
Werkzeuge: Ollama, Open WebUI und vLLM
Drei Werkzeuge decken fast alle Fälle ab. Sie lösen unterschiedliche Probleme und ergänzen sich.
| Werkzeug | Aufgabe | Stärke | Grenze |
|---|---|---|---|
| Ollama | Modelle lokal laden und ausführen | schnellster Einstieg, sehr einfache Bedienung | auf Durchsatz für viele Nutzende nicht ausgelegt |
| Open WebUI | Chat-Oberfläche mit Nutzerverwaltung | macht das Modell für Mitarbeitende nutzbar | ersetzt keine Governance |
| vLLM | Hochleistungs-Inferenzserver | hoher Durchsatz bei parallelen Anfragen | mehr Einrichtungs- und Betriebsaufwand |
Der typische Weg: Ollama für den Machbarkeitsnachweis, Open WebUI als Arbeitsoberfläche, vLLM sobald mehrere Teams gleichzeitig zugreifen. Alle drei sprechen eine OpenAI-kompatible Schnittstelle. Ein Wechsel des Servers zwingt also nicht zum Umbau der Anwendungen, genau das reduziert Abhängigkeit.
Welche Modelle überhaupt infrage kommen, ordnet der Überblick zu Open Source LLMs ein.
Die Kostenrechnung: Self-Hosted gegen API
Jetzt die Zahlen. Ein GPU-Server kostet einen festen Betrag pro Monat, unabhängig von der Nutzung. Eine API kostet pro Token: wenig bei kleinem Volumen, viel bei großem. Irgendwo schneiden sich beide Linien.
Die Rechnung mit belegten Preisen: Ein dedizierter GPU-Server liegt bei 889 € im Monat (Quelle: Hetzner, 2025). Eine Frontier-API wie Claude Sonnet kostet 2 $ je Million Eingabe- und 10 $ je Million Ausgabe-Tokens (Quelle: Anthropic, 2026), bei einem Verhältnis von drei zu eins rund 4 $ je Million Tokens gemischt. Eine gehostete Open-Model-API liegt deutlich darunter: Qwen3 235B kostet bei Together AI 0,20 $ Eingabe und 0,60 $ Ausgabe je Million Tokens (Quelle: Together AI, 2026), gemischt rund 0,30 $.
Das Ergebnis ist unbequem. Der Break-even gegenüber der Frontier-API liegt bei rund 222 Millionen Tokens pro Monat, etwa 7,4 Millionen Tokens am Tag oder grob 3.700 umfangreiche Anfragen täglich. Das erreichen wenige Mittelständler. Gegen eine gehostete Open-Model-API rechnet sich der eigene Server praktisch nie, weil die Anbieter ihre GPUs über viele Kunden auslasten.
Nicht eingerechnet sind Betriebsaufwand, Bereitschaft und Ausfallsicherheit. Wer diese Posten ehrlich ansetzt, verschiebt den Break-even weiter nach rechts. Wie sich Token-Kosten grundsätzlich senken lassen, zeigt der Beitrag zu token-smarter Architektur.
Die Konsequenz: Self-Hosting ist selten eine Kostenentscheidung. Es ist eine Kontrollentscheidung.
Fazit: Drei Fragen vor der Entscheidung
Drei Fragen führen zu einer belastbaren Antwort.
- Müssen die Daten im Haus bleiben? Wenn ja, aus rechtlichen oder vertraglichen Gründen, ist Self-Hosting oft alternativlos, unabhängig vom Preis.
- Ist die Last hoch und gleichmäßig? Nur dann trägt die feste Monatsgebühr. Schwankende Nutzung spricht klar für eine API.
- Gibt es Menschen für den Betrieb? Ohne benannte Verantwortung und Zeitbudget wird aus dem eigenen Server ein Projekt ohne Betreuung.
Zwei Mal Ja bei Frage 1 und 3 genügt meist. Nur Frage 2 allein trägt die Entscheidung nicht.
Der pragmatische Weg beginnt klein: ein offenes Modell auf vorhandener Hardware, ein klar umrissener Anwendungsfall, gemessene Nutzung über drei Monate. Danach steht die Rechnung auf Daten statt auf Annahmen. Genau so gehört die Frage in einen dauerhaften AI-Betrieb, als Teil von AI Operations, nicht als Einzelentscheidung.
Häufige Fragen zum eigenen LLM
Was kostet es, ein eigenes LLM zu betreiben?
Für erste Tests auf vorhandener Hardware entstehen kaum Kosten außer Strom und Zeit. Ein dedizierter GPU-Server mit 96 GB Grafikspeicher beginnt bei 889 € pro Monat (Quelle: Hetzner, 2025). Dazu kommt der Betriebsaufwand im eigenen Team, der in fast jeder Rechnung fehlt.
Welche Hardware braucht ein LLM mindestens?
Für quantisierte Modelle mit 7 bis 8 Milliarden Parametern genügen 8 bis 12 GB VRAM. Für 70-Milliarden-Modelle in Quantisierung sind rund 48 GB nötig. Der Speicherbedarf ergibt sich näherungsweise aus Parameterzahl mal Bits pro Gewicht geteilt durch acht.
Ist Ollama für den produktiven Einsatz geeignet?
Für einzelne Nutzende und Prototypen ja. Bei vielen parallelen Anfragen stößt Ollama an Grenzen. Dann ist vLLM die passende Wahl. Beide bieten eine OpenAI-kompatible Schnittstelle, der Wechsel ist deshalb überschaubar.
Ist Self-Hosting günstiger als eine API?
In den meisten Fällen nicht. Der Break-even gegenüber einer Frontier-API liegt bei rund 222 Millionen Tokens im Monat, gegenüber günstigen Open-Model-APIs meist gar nicht. Der Grund für Self-Hosting ist Datenkontrolle, nicht der Preis.
Wie lässt sich die Entscheidung sauber vorbereiten?
Mit einer Messung statt einer Schätzung: tatsächliches Token-Volumen, Datenschutzanforderungen und verfügbare Betriebskapazität. Wir ordnen das im kostenlosen Diagnose-Call ein.
Quellen
- Hetzner: GEX131 GPU-Server mit NVIDIA RTX PRO 6000 Blackwell Max-Q, 2025
- Hetzner: Dedicated GPU-Line, 2026
- OVHcloud: L40S Cloud GPU Instance, 2026
- Anthropic: Claude API Pricing, 2026
- Together AI: Pricing for Open Models, 2026
- Ollama: Dokumentation und Modellbibliothek, 2026
- Open WebUI: Projektdokumentation, 2026
- vLLM: Projektdokumentation, 2026
Autor & redaktionelle Verantwortung
Gründer & Geschäftsführer
Gründer und Geschäftsführer der netzstrategen GmbH, seit 2006 an Bord. Sein Fokus: Datenmessung, Analytik und Strategiedefinition. Heute vor allem der Aufbau von AI Operations, von der Strategie bis zum laufenden Betrieb. Branchenerfahrung in Pharma, Automobil und Fertigungsindustrie.
So ist dieser Beitrag entstanden
- Themenwahl
- Quellenwahl
- Faktenprüfung
- Freigabe
- Recherche
- Textentwurf
- Schaubilder
- Publishing
Dieser Beitrag entstand mit AI-Unterstützung. Ideenfindung, Redaktionsplanung, inhaltliche Prüfung und Freigabe liegen beim Menschen, das Lektorat bei der AI. Die redaktionelle Verantwortung trägt André Hellmann.
So geht es weiter
AI-Potenzial einschätzen
In 5 Minuten: konkrete Einschätzung, wo das Unternehmen bei AI steht.
Self-Check starten →Digital Impact direkt ins Postfach
Eine Anmeldung, drei Newsletter: der AI Insights Newsletter jede Woche mit den neuesten Insights-Artikeln, der Digital Impact Longread Newsletter und das Digital Impact Update je einmal im Monat. Mit Double Opt-in und jederzeit abbestellbar.
AI Operations zum Hören
Digital-Experten wie André Hellmann, Christina D'Ilio, Christian Sattel, Sarah Stock sowie regelmäßig Gäste aus der Praxis: alle Themen rund um AI Operations als Audio für unterwegs.
AI-Potenzial des Unternehmens in 5 Minuten einschätzen
Self-Check starten →Den nächsten Schritt mit einem Experten besprechen
Termin buchen →Claude im Team verankern statt einzeln ausprobieren? Der Claude Schnellstart liefert Setup, Quick Wins und Rollout-Fahrplan.
Schnellstart ansehen