Das Ende der AI-Magie: Warum Unternehmen ihren Human Share kennen müssen
Veröffentlicht am 24.9.2026 · Sven Maier
Ein Satz eingeben, ein fertiger Text kommt zurück. AI wirkt wie Zauberei. Wer sie allerdings in Geschäftsprozesse einbaut, darf nicht an Zauberei glauben. Hinter der Oberfläche steckt keine autonome Intelligenz, sondern organisierte menschliche Arbeit, beim Training der Modelle und im täglichen Betrieb. Dieser Anteil hat bisher keinen Namen. Wir nennen ihn Human Share.
Den nächsten Schritt im kostenlosen Diagnose-Call besprechen. Termin buchen →
Inhalt
- Die Illusion der Magie
- Wie AI tatsächlich entsteht
- Warum das Magie-Narrativ überlebt
- Human Share: ein Begriff, den wir selbst einführen
- Drei Fragen für morgen früh
- Was AI Operations daraus macht
- Fazit: Messbar wird nur, was dokumentiert ist
- Häufige Fragen zum Human Share
- Quellen
Die Illusion der Magie
Die Oberfläche verbirgt den Bau. Ein Prompt geht rein, ein brauchbares Ergebnis kommt raus. Der Weg dazwischen bleibt unsichtbar.
Für private Nutzung spielt das keine Rolle. Für den Betrieb schon. Wer ein System in einen Geschäftsprozess stellt, haftet für dessen Ergebnisse. Haftung ohne Verständnis der Fertigungskette ist keine Haltung, sondern ein offenes Risiko.
Das gilt doppelt, wenn AI Aufgaben übernimmt, die vorher Menschen erledigt haben. Dann verschiebt sich die Arbeit nicht ins Nichts. Sie verschiebt sich an eine andere Stelle, meist an eine, die niemand mehr dokumentiert.
Wie AI tatsächlich entsteht
Sprachmodelle lernen in zwei Phasen. Zuerst das Vortraining auf großen Textmengen. Dann die Feinjustierung auf erwünschtes Verhalten. Die zweite Phase entscheidet darüber, wie sich ein Modell im Alltag verhält und sie läuft über menschliche Urteile.
Das Standardverfahren heißt Reinforcement Learning from Human Feedback, kurz RLHF. Menschen bekommen zwei Antworten eines Modells und wählen die bessere. Aus vielen solcher Vergleiche entsteht ein Belohnungsmodell, das das Sprachmodell dann nachtrainiert.
Wie klein diese Gruppe sein kann, zeigt die Veröffentlichung, die das Verfahren bekannt gemacht hat. Für InstructGPT (den direkten Vorläufer der heutigen Chatmodelle) beschreibt OpenAI ein Team von etwa 40 Vertragskräften, angeworben über Upwork und Scale AI (Quelle: Ouyang et al., OpenAI, 2022). Die Trainingsdatensätze umfassten rund 13.000 Prompts für die überwachte Feinjustierung und rund 33.000 für das Belohnungsmodell (Quelle: Ouyang et al., OpenAI, 2022).
Drei Details aus derselben Veröffentlichung sind für den Betrieb wichtiger als die Zahlen selbst.
Die Bewertenden waren sich oft uneinig. Die Übereinstimmung untereinander lag bei rund 73 Prozent (Quelle: Ouyang et al., OpenAI, 2022). Bei gut einem Viertel der Fälle gab es also kein gemeinsames Urteil darüber, welche Antwort besser ist.
Die meisten Vergleiche liefen einfach besetzt. Die meisten Vergleiche seien aus Kostengründen nur von einer Vertragskraft bewertet worden, schreiben die Autor:innen selbst (Quelle: Ouyang et al., OpenAI, 2022; Übersetzung netzstrategen). Ein Urteil, eine Person, kein Vier-Augen-Prinzip.
Die Maßstäbe kamen nicht von den Bewertenden. Die Anleitungen schrieben die Forschenden: sie selbst verfassten die Vorgaben, an denen sich die Bewertenden orientierten. Das steht im Abschnitt zur Frage, an wessen Präferenzen das Modell eigentlich ausgerichtet wird (Quelle: Ouyang et al., OpenAI, 2022).
Das ist keine Kritik am Verfahren. RLHF funktioniert, und zwar erstaunlich effizient: Die Feinjustierung des 175-Milliarden-Modells kostete 60 Petaflops/s-Tage gegenüber 3.640 für das Vortraining von GPT-3 (Quelle: Ouyang et al., OpenAI, 2022). Ein kleiner Nachtrag an Rechenzeit, ein großer Effekt auf das Verhalten.
Das ist der Punkt. Ein kleiner, menschlich geprägter Schritt entscheidet über das Verhalten des Systems, das im Unternehmen antwortet.
Warum das Magie-Narrativ überlebt
Die Erzählung von der autonomen Intelligenz ist nützlich. Sie zieht Kapital an, sie verkauft Lizenzen, sie erspart unbequeme Fragen. Der mechanische Teil (Datenkuration, Bewertungsanleitungen, Vier-Augen-Prinzipien) taucht in keiner Keynote auf.
Die Forschung sieht das nüchterner. Eine Arbeit der Konferenz für Fairness, Accountability and Transparency beschreibt drei unterschiedliche Rollen, die Bewertende in RLHF-Verfahren einnehmen können: Sie verlängern das Urteil der Entwickelnden, sie liefern unabhängige Evidenz, oder sie handeln als Vertretung der Allgemeinheit (Quelle: Coyne, FAccT ‘26, 2026). Welche Rolle gilt, wird in den meisten Verfahren nie ausgesprochen.
Die Folge nennt die Arbeit „responsibility laundering”, also das Waschen von Verantwortung: Nach außen klingt ein Verfahren nach breiter gesellschaftlicher Beteiligung, im Inneren bleibt es die Entscheidung weniger Entwickelnder (Quelle: Coyne, FAccT ‘26, 2026). Verantwortung wird nicht geteilt, sie wird nur schwerer zuzuordnen.
Für Unternehmen hat das eine unangenehme Konsequenz. Wer sich an eine fertige Schnittstelle hängt, übernimmt nicht nur eine Technologie. Er übernimmt auch Entscheidungen, die jemand anderes getroffen und nicht offengelegt hat.
Wer den menschlichen Anteil nicht kennt, kennt sein System nicht. Er kennt nur dessen Oberfläche.
Auch die Gegenbewegung ändert daran wenig. Anthropic hat mit Constitutional AI ein Verfahren vorgestellt, das ohne menschliche Kennzeichnung schädlicher Ausgaben auskommt. Die einzige menschliche Aufsicht erfolge über eine Liste von Regeln oder Prinzipien, heißt es dort (Quelle: Anthropic, Constitutional AI, 2022; Übersetzung netzstrategen). Der menschliche Anteil verschwindet dabei nicht. Er wandert nach vorn, in die Auswahl der Prinzipien.
Human Share: ein Begriff, den wir selbst einführen
Eine Klarstellung gehört an diese Stelle: Human Share ist kein etablierter Kennwert. Es gibt keine Norm, keine Studie und keinen Standard, der ihn definiert. Wir führen den Begriff bewusst ein, weil uns eine Bezeichnung für etwas fehlt, das in jedem AI-Betrieb vorkommt und nirgends benannt wird.
Human Share meint: der Anteil menschlicher Arbeit, der nötig ist, damit ein AI-Ergebnis brauchbar wird. Nicht die Trainingsarbeit beim Anbieter, die lässt sich von außen kaum beziffern. Sondern die Arbeit im eigenen Betrieb: Prompts, die jemand nachschärft. Ergebnisse, die jemand korrigiert. Fälle, die jemand aussortiert, bevor sie den Kunden erreichen.
Dieser Anteil gilt heute als Makel. Als Beleg dafür, dass die Automatisierung noch nicht fertig ist. Diese Bewertung führt in die falsche Richtung. Ein hoher, bekannter Human Share ist besser als ein niedriger, unbekannter. Bekannt heißt steuerbar.
Dass menschliche Eingriffe nicht verschwinden, ist auch regulatorisch angelegt. Die KI-Verordnung verlangt für Hochrisiko-Systeme eine Datenverwaltung, die Trainings-, Validierungs- und Testdaten auf Relevanz, Repräsentativität und Fehlerfreiheit prüft (Quelle: Verordnung (EU) 2024/1689, Art. 10). Wer diese Prüfung nicht dokumentiert, kann sie nicht nachweisen.
Wie eng Datenqualität und AI-Ergebnis zusammenhängen, beschreibt der Beitrag zur Datenqualität. Was bei Kennzeichnungspflichten nach Art. 50 gilt, steht in der AI-Kennzeichnungspflicht.
Drei Fragen für morgen früh
Niemand kann den Human Share heute exakt beziffern. Wir auch nicht. Das ist kein Grund, die Frage zu überspringen: sie lässt sich beantworten, lange bevor es eine Kennzahl gibt.
- Wo greifen Menschen in eure AI-Ergebnisse ein? Wisst ihr es, oder vermutet ihr es? Der Unterschied zwischen beidem ist der Unterschied zwischen Betrieb und Bastelei.
- Ist der Eingriff Routine oder Ausnahme? Routine heißt: Der Prozess ist nicht fertig. Ausnahme heißt: Der Prozess hat eine Grenze, und jemand kennt sie.
- Passiert der Eingriff wieder, wenn die Person kündigt? Wenn nicht, hängt das System an einem Menschen. Nicht an einem Ablauf.
Wer diese drei Fragen beantwortet, hat noch keinen Kennwert. Aber Kontrolle.
Welche Abläufe im konkreten Fall betroffen sind, ordnen wir im kostenlosen Diagnose-Call ein.
Was AI Operations daraus macht
AI Operations heißt: AI als Betriebsfunktion führen, nicht als Projekt. Für den Human Share bedeutet das vier konkrete Festlegungen.
- Herkunft nachvollziehbar halten. Welches Modell, welche Version, welche Konfiguration hat ein Ergebnis erzeugt? Ohne diese Angabe lässt sich ein Fehler nicht eingrenzen.
- Eingriffe protokollieren. Jede Korrektur an einem AI-Ergebnis wird als Ereignis erfasst, nicht als stille Handarbeit. Aus der Menge dieser Ereignisse entsteht der erste belastbare Wert.
- Verantwortung benennen. Für jeden Ablauf eine Person, wie für jede Maschine im Betrieb. Ohne Adressat verteilt sich Verantwortung, bis niemand sie trägt.
- Wissen im Haus behalten. Wer die eigenen Abläufe versteht, kann den Anbieter wechseln. Wer sie nicht versteht, kann es nicht.
Diese vier Punkte sind kein Softwareprojekt. Sie sind eine Frage der Organisation und genau deshalb bauen wir Systeme gemeinsam mit dem Team, statt für das Team. Warum, steht in Built with the Team.
Wie sich Entscheidungsrechte und Autonomiestufen konkret regeln lassen, beschreibt der Beitrag zu Governance, Kontrolle und Autonomie.
Fazit: Messbar wird nur, was dokumentiert ist
AI ist großartige Technik. Sie ist keine Magie. Zwischen Prompt und Ergebnis liegen Entscheidungen, die Menschen getroffen haben, teils beim Anbieter, teils im eigenen Haus.
Der Anteil beim Anbieter bleibt größtenteils verborgen. Der Anteil im eigenen Haus nicht. Er lässt sich beschreiben, protokollieren und verantworten. Genau da setzt AI Operations an: Übergaben werden dokumentiert, Verantwortung wird zugewiesen, Eingriffe bleiben nachvollziehbar.
Aus verstreuter Handarbeit wird ein Betrieb, den ihr steuern könnt. Das ist unspektakulärer als Magie. Es hält dafür einem Audit stand.
Häufige Fragen zum Human Share
Was ist der Human Share?
Der Anteil menschlicher Arbeit, der nötig ist, damit ein AI-Ergebnis brauchbar wird, von der Datenkuration bis zur Korrektur vor dem Versand. Der Begriff ist kein etablierter Kennwert. Wir führen ihn ein, weil eine Bezeichnung für diesen Anteil bisher fehlt.
Wie viele Menschen stecken im Training eines Sprachmodells?
Für die meisten aktuellen Modelle ist das nicht öffentlich. Belegt ist es für InstructGPT: OpenAI beschreibt ein Team von etwa 40 Vertragskräften, das die Demonstrations- und Vergleichsdaten erzeugte (Quelle: Ouyang et al., OpenAI, 2022). Zahlen für neuere Modelle liegen nicht in vergleichbarer Form vor.
Ist ein hoher Human Share schlecht?
Nein. Schlecht ist ein unbekannter Human Share. Ein hoher, dokumentierter Anteil zeigt, wo ein Prozess noch nicht fertig ist und wo sich Automatisierung als Nächstes lohnt.
Was sagt die KI-Verordnung zum Thema?
Für Hochrisiko-Systeme verlangt Art. 10 der Verordnung (EU) 2024/1689 eine Datenverwaltung, die Trainings-, Validierungs- und Testdaten auf Relevanz, Repräsentativität und Fehlerfreiheit prüft. Die Pflicht gilt unabhängig davon, ob personenbezogene Daten betroffen sind.
Wie fangen wir an, den Human Share zu erfassen?
Mit einem einzigen Ablauf. Eine Woche lang jede Korrektur an einem AI-Ergebnis notieren: Wer, an welcher Stelle, warum. Das Ergebnis ist meist überraschend und es ist die Grundlage für alles Weitere. Wo der Einstieg am meisten bringt, klären wir im kostenlosen Diagnose-Call.
Quellen
- Ouyang et al., OpenAI, 2022: Training language models to follow instructions with human feedback, arXiv:2203.02155
- Anthropic, 2022: Constitutional AI: Harmlessness from AI feedback, 15.12.2022
- Coyne, Steve, FAccT ‘26, 2026: Three Models of RLHF Annotation: Extension, Evidence, and Authority, arXiv:2604.25895
- Europäische Union, 2024: Verordnung (EU) 2024/1689 (KI-Verordnung), Art. 10: Daten und Daten-Governance
So ist dieser Beitrag entstanden
- Themenwahl
- Quellenwahl
- Faktenprüfung
- Freigabe
- Recherche
- Textentwurf
- Schaubilder
- Publishing
Dieser Beitrag entstand mit AI-Unterstützung. Ideenfindung, Redaktionsplanung, inhaltliche Prüfung und Freigabe liegen beim Menschen, das Lektorat bei der AI. Die redaktionelle Verantwortung trägt Sven Maier.
So geht es weiter
AI-Potenzial einschätzen
In 5 Minuten: konkrete Einschätzung, wo das Unternehmen bei AI steht.
Self-Check starten →Digital Impact direkt ins Postfach
Eine Anmeldung, drei Newsletter: der AI Insights Newsletter jede Woche mit den neuesten Insights-Artikeln, der Digital Impact Longread Newsletter und das Digital Impact Update je einmal im Monat. Mit Double Opt-in und jederzeit abbestellbar.
AI Operations zum Hören
Digital-Experten wie André Hellmann, Christina D'Ilio, Christian Sattel, Sarah Stock sowie regelmäßig Gäste aus der Praxis: alle Themen rund um AI Operations als Audio für unterwegs.
AI-Potenzial des Unternehmens in 5 Minuten einschätzen
Self-Check starten →Den nächsten Schritt mit einem Experten besprechen
Termin buchen →Claude im Team verankern statt einzeln ausprobieren? Der Claude Schnellstart liefert Setup, Quick Wins und Rollout-Fahrplan.
Schnellstart ansehen