Insights
KI-Ergebnisse prüfen: OpenAIs 372 Beweise liest niemand
Die Beweise liegen auf GitHub, aber kaum ein Mensch hat sie bisher nachvollzogen. Warum das Gefälle zwischen billigem Erzeugen und teurem Prüfen auch Ihre KI-Anwendungen betrifft.

OpenAI hat Lösungen für Hunderte offene Mathematikprobleme veröffentlicht, und die Fachwelt steht vor einer ungewohnten Lage: Die Beweise sind da, aber kaum ein Mensch hat sie bisher verstanden1. Für Unternehmen ist das mehr als eine Anekdote aus der Forschung. Es zeigt in extremer Form, was jede KI-Nutzung früher oder später einholt: Ein Ergebnis, das niemand prüfen kann, ist kein Ergebnis, sondern eine Behauptung.
Was OpenAI veröffentlicht hat
Ende September hatte OpenAI angekündigt, 100 offene Mathematikprobleme gelöst zu haben2. Am Dienstag folgten 722 Manuskripte auf GitHub, gegliedert in 372 Forschungsfamilien, mit Ergebnissen aus Zahlentheorie, theoretischer Informatik und mathematischer Physik3. Geschrieben hat sie ein bislang unveröffentlichtes internes Modell, das während des Projekts rund 4000 Probleme angegangen ist3. Für jedes akzeptierte Ergebnis brauchte es im Schnitt Rechenleistung in der Größenordnung von drei Stunden Denkzeit in ChatGPT Pro3.
Darunter sind Resultate, an denen Forschende teils ihr ganzes Berufsleben gearbeitet haben. Der Informatiker Scott Aaronson nennt den Tag in seinem Blog einen der größten in der Geschichte der Mathematik und hebt unter anderem einen Beweis der Unique Games Conjecture hervor, einer zentralen Vermutung der Komplexitätstheorie1.
Die Beweise sind da, verstanden hat sie noch niemand
Der interessante Teil steht im Kleingedruckten. Für viele, aber nicht alle Beweise liefert OpenAI Code in der Beweissprache Lean mit, mit dem ein Computer die logischen Schritte automatisch prüfen kann3, 1. Gleichzeitig schreibt Aaronson, dass bislang praktisch kein Mensch einen dieser Beweise verstanden hat. Das Rennen darum habe gerade erst begonnen1.
Wie dieses Rennen aussieht, zeigt eine Nachricht der Komplexitätstheoretikerin Dana Moshkovitz, die Aaronson zitiert: Die Arbeit sei so schlecht geschrieben, dass man sie ohne KI-Hilfe nicht lesen könne, und die Zitate seien oft irrelevant und verwirrend1. Die Maschine liefert. Der Mensch braucht wieder eine Maschine, um zu verstehen, was die erste geliefert hat.
Ganz pessimistisch ist Moshkovitz dabei nicht. Sie beschreibt auch eine mögliche Zukunft, in der Menschen mit Ideen und Urteilsvermögen der KI das Prüfen und Ausarbeiten überlassen1. Bis dahin ringt die Forschungsgemeinde noch um den Umgang mit den neuen Resultaten, wie derStandard berichtet2.
Selbst die formale Prüfung hat eine Grenze. Lean bestätigt, dass die Schritte logisch korrekt sind. Ob ein Ergebnis relevant oder originell ist, beantwortet es nicht3. Mathematiker sorgen sich deshalb, dass die Masse an KI-Beweisen die menschliche Kapazität zur Prüfung übersteigt3.
Warum das in Ihrem Unternehmen genauso auftaucht
Sie werden keine Beweise aus der Zahlentheorie prüfen müssen. Das Muster kennen Sie trotzdem, nur kleiner. Ein KI-Agent fasst vierzig Verträge zusammen, und niemand liest die Verträge noch einmal. Ein Programm, das die KI geschrieben hat, läuft seit Monaten, und keiner im Team könnte erklären, warum es an einer bestimmten Stelle so rechnet, wie es rechnet.
In beiden Fällen ist das Erzeugen billig geworden und das Prüfen teuer geblieben. Genau dieses Gefälle erlebt die Mathematik gerade im Großformat. Wer KI im Betrieb einsetzt, sollte es nicht erst im Schadensfall bemerken, sondern beim Aufbau des Systems einplanen.
Was Mathematiker richtig machen und Unternehmen kopieren können
Die Mathematik hat auf das Problem eine Antwort, die sich übertragen lässt: Sie trennt das Prüfen der Korrektheit vom Prüfen der Bedeutung. Lean übernimmt das Erste automatisch, Menschen konzentrieren sich auf das Zweite3.
Für ein KI-System im Betrieb heißt das: Bauen Sie automatische Prüfungen überall dort ein, wo sich Korrektheit formal feststellen lässt. Summen, die aufgehen müssen. Pflichtfelder, die gefüllt sein müssen. Zitate, die auf eine echte Stelle im Quelldokument zeigen. Was so geprüft ist, muss kein Mensch mehr nachrechnen. Die knappe menschliche Aufmerksamkeit bleibt für die Frage, ob das Ergebnis fachlich Sinn ergibt.
Verlangen Sie außerdem Ergebnisse in einer Form, die sich prüfen lässt. Eine KI-Antwort mit Verweis auf die Fundstelle kontrollieren Sie in Sekunden. Dieselbe Antwort als glatter Fließtext kostet Sie entweder eine halbe Stunde Nacharbeit oder Ihr Vertrauen. Wie Kontrollpunkte in agentischen Systemen konkret aussehen, beschreiben wir in Agentische KI im Unternehmen.
Was Sie jetzt tun können
Nehmen Sie die KI-Anwendung, die bei Ihnen die meisten Ergebnisse produziert, und stellen Sie eine einzige Frage: Wer prüft diese Ergebnisse heute, wie lange dauert das, und was wird gar nicht geprüft? Lautet die ehrliche Antwort „niemand“, haben Sie dieselbe Lage wie die Mathematik in dieser Woche, nur ohne Lean-Zertifikat.
Wenn Sie wissen wollen, welche Prüfungen sich in Ihrem Ablauf automatisieren lassen, sprechen Sie mit uns im Potenzial-Check.