DoGBench: Schreibt KI schon gute Dokumentation?

DoGBench: KI-Dokumentation im Test

Immer mehr Unternehmen übertragen ihre Dokumentation an KI-Agenten. Die Idee ist verlockend: Ein Entwickler ändert den Code, und ein Agent aktualisiert automatisch das Benutzerhandbuch. Doch wie gut ist das Ergebnis? Systematisch gemessen hatte das bisher niemand.

Das hat sich jetzt geändert. Die Dokumentationsplattform Promptless hat DoGBench (Documentation Generation Benchmark) veröffentlicht, den ersten Benchmark, der prüft, ob KI-Agenten Anwenderdokumentation erstellen können, die eine erfahrene technische Redakteurin oder ein erfahrener technischer Redakteur in der Prüfung akzeptieren würde. Die kurze Antwort: noch nicht. (Quelle: Promptless, englisch)

So funktioniert der Benchmark

DoGBench umfasst 292 Aufgaben aus echten Open-Source-Projekten wie Helm, PostHog und Mautic. Bei 205 davon muss die Dokumentation geändert werden: neue Inhalte, Aktualisierungen oder das Entfernen veralteter Passagen. Bei den übrigen 87 ist die richtige Antwort, die Dokumentation unverändert zu lassen.

Jeder Agent erhält das Repository im Zustand vor der Änderung sowie einen Auslöser, etwa eine Codeänderung oder eine gemeldete Lücke in der Dokumentation. Er muss selbst entscheiden, ob Anwender betroffen sind und ob die Dokumentation überhaupt angepasst werden muss. Bewertet werden die Ergebnisse anhand detaillierter Kriterien, die gemeinsam mit den Verantwortlichen der Projekte entwickelt wurden: Richtigkeit, Vollständigkeit, Leserführung, Platzierung, Stil und die Konventionen des Projekts. Wer einen kritischen Fehler macht, kann für diese Aufgabe höchstens 60 von 100 Punkten erreichen, egal wie gut der Rest ist.

Die Ergebnisse: gut formuliert, aber nicht verlässlich

Getestet wurden sieben Kombinationen aus KI-Modell und Agenten-Software. Die beste erreichte 47,3 von 100 Punkten. Noch aufschlussreicher sind die Details:

  • Wann ändern? Eine schwierige Frage. Manche Agenten dokumentierten interne Änderungen, die für Anwender keine Rolle spielen. Andere übersahen notwendige Aktualisierungen, weil es zum Thema noch keine Seite gab. Bei Aufgaben, die keine Änderung erforderten, lagen die Agenten nur in 28,6 % bis 85,7 % der Fälle richtig.
  • Leser bleiben stecken. In einer Prüfung von 1.267 Einreichungen hatten 45,5 % eine Lücke, die Leser daran hindert, ihre Aufgabe abzuschließen, etwa eine fehlende Voraussetzung, ein fehlender Schritt oder eine fehlende Kontrolle.
  • Fehler sind schwer zu erkennen. 36,6 % enthielten technische Ungenauigkeiten. Diese sind oft subtil: ein falsch angegebener Standardwert oder ein Verhalten, das nur unter bestimmten Bedingungen gilt, aber als allgemeingültig dargestellt wird. Wer nur überfliegt, übersieht sie leicht.
  • Wenig ist fehlerfrei nutzbar. Im besten Fall waren 39 % der gelieferten Texte frei von kritischen Fehlern.

Laut den Forschenden beginnen die Probleme schon vor dem Schreiben, nämlich bei der Recherche. Die Agenten hörten oft bei der ersten passenden Seite auf, füllten Lücken mit Annahmen oder beschrieben eine Schnittstelle, ohne zu prüfen, wie Leser sie tatsächlich nutzen.

Was das für Ihre technische Dokumentation bedeutet

Die Studie bestätigt, was wir bei Lexsys täglich erleben: Gute Dokumentation entsteht nicht durch gut formulierte Sätze. Sie entsteht durch das Verständnis dafür, wer die Leser sind, was sie erreichen wollen und welche Informationen sie dafür brauchen. Dieses Wissen steckt oft nicht im Code selbst.

KI-Agenten können ein nützliches Hilfsmittel sein, zum Beispiel für erste Entwürfe oder um die von einer Änderung betroffenen Seiten zu finden. Ihre Ergebnisse brauchen aber die Prüfung durch Fachleute. Die Autoren der Studie empfehlen, jeden KI-Entwurf aus Sicht der Leser zu prüfen:

  • Finden Leser die Information, können sie die Schritte ausführen und das Ergebnis überprüfen?
  • Stimmt jede technische Aussage, und unter welchen Bedingungen gilt sie?
  • Widersprechen verwandte Seiten dem neuen Inhalt, oder sind sie jetzt veraltet?

Das gilt umso mehr für mehrsprachige Dokumentation. Jeder Fehler im Ausgangstext vervielfacht sich mit jeder Übersetzung.

Unser Fazit

DoGBench liefert Dokumentationsverantwortlichen belastbare Argumente für das Gespräch mit der Geschäftsführung: KI kann die Dokumentation beschleunigen, professionelle technische Redakteure aber noch nicht ersetzen. Die besten Ergebnisse entstehen aus der Kombination: KI als Werkzeug und Fachleute, die dafür sorgen, dass die Dokumentation Lesern wirklich hilft.

Sie möchten KI in Ihrem Dokumentationsprozess einsetzen, ohne Qualität einzubüßen? Erfahren Sie, wie wir Sie bei Ihrer technischen Dokumentation unterstützen.

Über den Autor