Zum Inhalt springen

Insights

Maschinenlesbare KI-Kennzeichnung: So bauen Sie Metadaten, Provenance und Audit-Trails belastbar ein

Maschinenlesbare KI-Kennzeichnung muss technisch nachweisbar sein. Bauen Sie Metadaten, C2PA-Provenance und Audit-Trails belastbar ein.

Dawid Sochacki23. September 20268 Min Lesezeit
Maschinenlesbare KI-Kennzeichnung: So bauen Sie Metadaten, Provenance und Audit-Trails belastbar ein

Maschinenlesbare KI-Kennzeichnung ist seit dem 2. August 2026 keine Kommunikationsaufgabe mehr, sondern eine Anforderung an Ihre Software. Wer KI-Inhalte veröffentlicht oder Nutzer mit einem KI-System interagieren lässt, braucht sichtbare Hinweise, belastbare Metadaten und einen Nachweis, der auch nach dem Export aus dem CMS noch überprüfbar ist.

Der EU AI Act verlangt technische Umsetzung statt Erinnerungsmails

Die Transparenzpflichten des EU AI Act treffen deutlich mehr Unternehmen als die Regeln für Hochrisiko-KI. Ein Website-Chatbot, ein Bildgenerator im Marketing oder ein System, das Kundenantworten formuliert, genügt bereits. Bei der Interaktion muss ein Mensch erkennen können, dass er mit einem KI-System spricht. Synthetische Inhalte müssen unter den gesetzlichen Voraussetzungen erkennbar und maschinenlesbar markiert werden.

Dabei lohnt sich Genauigkeit. Der EU AI Act verlangt nicht pauschal, jeden Text zu kennzeichnen, an dem irgendwann ein Sprachmodell beteiligt war. Für öffentlich bereitgestellte Texte gelten Ausnahmen, wenn eine natürliche Person redaktionelle Verantwortung und wirksame Kontrolle übernimmt. Anders liegt der Fall bei Inhalten, die über Angelegenheiten von öffentlichem Interesse informieren, sowie bei manipulierten oder synthetischen Bild-, Audio- und Videoinhalten. Dort ist die Offenlegung besonders relevant. Wer intern mit der Regel „alles aus KI wird technisch erfasst“ arbeitet, hat trotzdem die bessere Ausgangslage: Die Rechtsabteilung kann später entscheiden, was veröffentlicht und sichtbar gekennzeichnet wird. Ohne technische Herkunftsdaten kann sie nichts entscheiden.

Ein typischer Fehler aus der Praxis: Das Marketing erhält einen Hinweis im Wiki, KI-Bilder künftig als solche zu markieren. Dann exportiert jemand um 18 Uhr ein Motiv aus einem Bildtool, lädt es in ein DAM-System hoch und die Herkunft ist weg. Das Problem ist nicht mangelnde Disziplin. Der Workflow lässt die Information schlicht fallen.

Chatbot-Kennzeichnung gehört fest in die Oberfläche

Ein Chatbot muss beim ersten Kontakt klar als KI-System erkennbar sein. Ein Satz in der Datenschutzerklärung erfüllt diesen Zweck praktisch nicht, weil Nutzer ihn nicht sehen, wenn die Interaktion beginnt.

Bauen Sie die Kennzeichnung deshalb in die Chat-Komponente ein, nicht in eine Content-Seite. Ein gut umgesetztes Interface zeigt etwa vor der ersten Nachricht: „Sie schreiben mit dem KI-Assistenten von [Unternehmen]. Antworten können fehlerhaft sein.“ Dieser Hinweis bleibt im sichtbaren Bereich, bis der Nutzer die erste Nachricht versendet hat. Das ist kein Design-Detail, sondern ein kontrollierbares Produktverhalten.

Wichtig ist der Übergabefall. Wenn ein Servicemitarbeiter in denselben Gesprächsverlauf einsteigt, muss die Oberfläche den Wechsel anzeigen. Ein Zeitstempel wie „10:42 – Antwort durch Kundenservice“ reicht, sofern der Wechsel für den Nutzer eindeutig ist. Übernimmt danach wieder der KI-Assistent, wird auch das protokolliert. Im Audit muss nachvollziehbar sein, welche Antwort von welchem Akteur kam.

Für Architekturteams bedeutet das: Der Conversation Store benötigt ein unveränderbares Feld wie actor_type mit den erlaubten Werten human und ai. Das Frontend rendert den Status aus diesem Feld; das Backend darf ihn nicht aus frei editierbarem Text ableiten. Wer die Kennzeichnung nur als CSS-Element aufsetzt, kann sie bei einem Frontend-Redesign versehentlich entfernen. Eine fachliche Regel im Datenmodell überlebt Releases besser.

Metadaten allein reichen für KI-Inhalte nicht aus

Metadaten sind der erste Baustein der maschinenlesbaren KI-Kennzeichnung, aber keine Beweiskette. EXIF-, IPTC- oder XMP-Felder lassen sich beim Bildexport löschen, bei Screenshots verschwinden sie vollständig. Ein JPEG mit dem Feld AI_GENERATED=true ist besser als gar nichts, aber kein Nachweis, auf den sich ein Unternehmen bei einer Prüfung verlassen sollte.

Für Bilder, Videos und Audiodateien ist C2PA der sinnvollste technische Standard. Die Coalition for Content Provenance and Authenticity definiert signierte Herkunftsinformationen, oft unter dem Namen Content Credentials sichtbar. Eine C2PA-Manifest-Datei kann festhalten, welches Tool einen Inhalt erzeugt oder verändert hat, welcher Prozessschritt erfolgte und welcher Schlüssel die Angaben signiert hat. Entscheidend ist die Signatur: Wird der Inhalt verändert, lässt sich die Verbindung zum ursprünglichen Manifest prüfen oder als ungültig erkennen.

Ein Beispiel: Ein Produktbild wird durch ein generatives Modell erweitert, weil im Original links Platz für einen Website-Teaser fehlt. Der Generierungsdienst erzeugt die C2PA-Information direkt beim Export. Das DAM-System speichert das Original, die abgeleitete Datei und das Manifest gemeinsam. Das CMS übernimmt beim Publizieren ein Feld provenance_status=verified. Fehlt das Manifest oder ist die Signatur ungültig, darf das Asset nicht automatisch als nachgewiesen gelten. Dann landet es in einer Prüfliste statt direkt auf der Website.

Bei Texten ist C2PA noch nicht überall in den Veröffentlichungswerkzeugen durchgängig nutzbar. Hier braucht es zusätzlich ein eigenes Provenance-Modell im CMS. Sinnvoll sind feste Felder wie ai_generation_id, model_id, human_reviewer_id und publication_decision. Die Felder gehören in den Content-Type, nicht in ein Freitextfeld für Redakteure. Ein PDF kann diese Angaben zusätzlich als XMP-Metadaten erhalten. Für HTML-Seiten sollten Sie strukturierte Angaben im CMS und im Auslieferungsprozess pflegen; ein bloßer Kommentar im Quellcode ist keine belastbare Kennzeichnung.

Ein Audit-Trail muss die Herkunft beweisen können

Der Audit-Trail verbindet Inhalt, Modellaufruf und menschliche Freigabe. Ohne diese Verbindung haben Sie viele Logs, aber keinen brauchbaren Nachweis.

Die robuste Lösung beginnt am zentralen KI-Gateway. Jeder Aufruf an ein Sprachmodell oder Bildmodell erhält dort eine eindeutige generation_id. Das Gateway protokolliert Zeitpunkt, Modellkennung, Modellversion, Mandant, verwendete Systemanweisung und die Hashwerte von Eingabe sowie Ausgabe. Personenbezogene oder vertrauliche Prompts gehören nicht ungefiltert in ein allgemeines Log. Häufig genügt ein kryptografischer Hash plus eine getrennt abgesicherte Referenz auf die Eingabe.

Die erzeugte Datei oder der Textdatensatz übernimmt diese generation_id. Bei einer redaktionellen Prüfung schreibt das CMS einen weiteren, nicht überschreibbaren Ereigniseintrag: wer freigegeben hat, wann dies geschah und auf welche konkrete Inhaltsversion sich die Freigabe bezieht. Sobald eine Ausgabe verändert wird, entsteht eine neue Version mit neuem Hash. Genau hier scheitern viele Eigenbauten: Sie speichern nur den letzten Stand eines Artikels. Im Streitfall lässt sich dann nicht mehr sagen, was die KI tatsächlich erzeugt hat und was später ein Mensch umformulierte.

Für kritische Nachweise empfehlen wir einen append-only Audit-Trail, also ein Protokoll, dessen Einträge nicht nachträglich geändert werden können. Technisch genügen je nach Schutzbedarf WORM-Speicher, ein versionierter Object Store mit Retention Lock oder eine Hash-Kette über die Ereignisse. Eine Blockchain brauchen Sie dafür fast nie. Sie erhöht Komplexität und Kosten, ohne das Kernproblem zu lösen: saubere Identitäten, eindeutige Versionen und eine geregelte Aufbewahrung.

Definieren Sie die Aufbewahrungszeit anhand von Risikoprofil, Verträgen und gesetzlichen Anforderungen. Für ein internes Ideenwerkzeug sind zwei Jahre oft mehr als ausreichend. Für KI-gestützte Kommunikation in einem regulierten Finanzprozess können längere Fristen nötig sein. Die Architektur muss beides abbilden, ohne jedes Log auf Vorrat für zehn Jahre zu speichern.

Die Kennzeichnung muss den Publikationsweg überstehen

Maschinenlesbare KI-Kennzeichnung ist nur so gut wie die letzte Systemgrenze. Ein C2PA-Manifest hilft wenig, wenn der Social-Media-Connector beim Upload alle Metadaten entfernt. Ein CMS-Feld hilft wenig, wenn die Landingpage als statisches HTML ohne Kennzeichnungslogik exportiert wird.

Erstellen Sie deshalb für jeden Veröffentlichungsweg einen einfachen technischen Test. Laden Sie ein KI-generiertes Testbild in das DAM, publizieren Sie es über CMS und CDN, dann prüfen Sie die ausgelieferte Datei mit einem C2PA-Validator. Erzeugen Sie einen KI-Text, lassen Sie ihn freigeben und prüfen Sie, ob die generation_id vom Gateway bis in den Archivdatensatz erhalten bleibt. Dieser Test gehört in die Release-Pipeline, ähnlich wie ein Sicherheits- oder Performance-Test.

Die unbequeme Wahrheit: Bei manchen Plattformen geht die Provenance beim Upload verloren. Dann können Sie die Plattform nicht zu einem besseren Metadatenhandling zwingen. Sie können aber den originalen, signierten Nachweis im eigenen Archiv halten und am veröffentlichten Inhalt eine sichtbare Kennzeichnung ergänzen. Das ist keine perfekte technische Kette, aber eine dokumentierte und ehrliche Grenze Ihrer Kontrolle.

FAQ

Was bedeutet maschinenlesbare KI-Kennzeichnung konkret?

Maschinenlesbare KI-Kennzeichnung bedeutet, dass Software die Kennzeichnung automatisiert auslesen kann. Dafür reichen sichtbare Hinweise wie „KI-generiert“ im Fließtext nicht aus. Geeignet sind strukturierte CMS-Felder, standardisierte Metadaten wie XMP oder signierte Provenance-Daten nach C2PA. Welche Kombination passt, hängt vom Inhaltstyp und Ausgabekanal ab.

Ist C2PA für jedes Unternehmen Pflicht?

C2PA ist kein im EU AI Act namentlich vorgeschriebener Standard. Der Standard ist aber derzeit die praktisch relevanteste offene Spezifikation für signierte Herkunftsinformationen bei Medieninhalten. Wer Bilder, Audio oder Videos KI-gestützt erzeugt und eine überprüfbare Provenance braucht, sollte C2PA als Standardoption bewerten statt ein eigenes Metadatenformat zu erfinden.

Reicht ein Log des KI-Anbieters als Audit-Trail?

Nein. Anbieterlogs können ablaufen, sind nicht immer vollständig exportierbar und bilden Ihre interne Freigabeentscheidung nicht ab. Ein belastbarer Audit-Trail liegt unter Ihrer Kontrolle und verknüpft Modellaufruf, Inhaltsversion, Veröffentlichung sowie menschliche Bearbeitung. Das ist auch ein Argument für ein zentrales KI-Gateway statt unkontrollierter Einzellösungen.

Müssen menschlich überarbeitete KI-Texte immer sichtbar gekennzeichnet werden?

Nicht zwingend. Der EU AI Act enthält für bestimmte veröffentlichte Texte Ausnahmen bei menschlicher redaktioneller Verantwortung und wirksamer Kontrolle. Die konkrete Bewertung hängt vom Zweck und Inhalt ab, insbesondere bei Themen von öffentlichem Interesse. Technisch sollten Sie die KI-Beteiligung dennoch erfassen, damit diese Entscheidung nachvollziehbar und nicht bloß behauptet werden kann.

Fazit

Für B2B-Unternehmen im Rhein-Main-Gebiet ist der sinnvolle nächste Schritt kein Schulungsdeck, sondern ein 90-Minuten-Review der realen Generierungs- und Publikationswege: Wo entsteht KI-Content, welche Kennzeichnung überlebt den Export, und wo fehlt der Audit-Trail? Wenn Sie in Darmstadt oder der Region Ihre KI-Potenziale für Ihr Unternehmen besprechen wollen, buchen Sie einen Termin und bringen Sie ein konkretes System mit – Chatbot, CMS oder KI-Gateway.

  • KI-Kennzeichnung
  • Metadaten
  • Provenance
  • Audit-Trails
  • EU-AI-Act

Mehr zum Thema

Termin buchen