Research Oktober 2026 Lesezeit ~22 Min

Agentic Design Research –
vom Rechercheauftrag zum Evidenzvermögen.

Wie agentische Recherche prüfbar wird – und warum der eigentliche Gewinn nicht Geschwindigkeit ist, sondern ein Evidenzbestand, der nicht mit dem Projekt stirbt. Auf Basis von zwei vollständig durchgeführten Rechercheoperationen, 22 Dokumenten, rund 96.000 Wörtern geprüfter Evidenz und einem Regelwerk aus zehn Prüfregeln, das jede einzelne Aussage passieren muss.

00 Einstieg

Warum Research beim Abliefern stirbt.

Jede Studie endet als PDF in einem Ordner. Das ist der Moment, in dem sie aufhört zu existieren.

Drei Monate später weiß niemand mehr, welche ihrer Aussagen noch gilt. Die Quellen sind gealtert, ohne dass es jemand bemerkt hätte. Der Kontext, in dem eine Zahl Sinn ergab, ist weg. Und der nächste Rechercheauftrag beginnt wieder bei null – oft zur selben Frage, manchmal im selben Haus, gelegentlich sogar im selben Team.

Das ist kein Fleißproblem und keine Frage der Sorgfalt. Es ist ein Formatproblem. Research wird als Fließtext abgeliefert, und Fließtext ist für Maschinen unzugänglich und für die Zukunft blind. Eine Fußnote sagt, woher eine Aussage stammt. Sie sagt nicht, aus welcher Fassung, mit welcher Sicherheit, und ob sie morgen noch stimmt.

Mit agentischer Recherche verschärft sich das Problem, statt sich zu lösen. Wer die Produktionsgeschwindigkeit verzehnfacht, ohne das Format zu ändern, produziert zehnmal so schnell zehnmal so viel Text, der in drei Monaten tot ist. Die meisten Angebote am Markt versprechen genau das und nennen es Fortschritt.

Wir haben 2026 zwei vollständige Rechercheoperationen agentisch geflogen. Was dabei zählte, war nicht die Geschwindigkeit – die stellte sich nebenbei ein. Es war, dass am Ende kein Text stand, sondern eine Struktur. Jede einzelne Aussage trug ihren Urheber, ihre Fassung, ihre Konfidenzstufe und ihre Herkunftsklasse. Nicht als nachträgliche Dokumentation, sondern als Bedingung ihrer Entstehung.

Dieser Artikel beschreibt, wie das funktioniert und was daraus folgt. Abschnitt 01 führt die Einheit ein, in der wir Recherche messen, und das Datenmodell dahinter. Abschnitt 02 ist das Regelwerk – zehn Regeln, die jede Aussage passieren muss. Abschnitt 03 beschreibt den Stack in sieben Schichten und die beiden Gate-Linien davor und dahinter. Abschnitt 04 zeigt ein reales Beispiel mit harten Zahlen. Abschnitt 05 benennt vier unbequeme Wahrheiten über agentische Recherche. Abschnitt 06 beschreibt, was aus vielen solchen Operationen entsteht. Abschnitt 07 nennt die Grenzen, ein Reifegradmodell und einen Selbsttest in fünf Fragen.

Der Wert einer Studie bemisst sich nicht daran, was sie beantwortet, sondern daran, wie lange die Antwort nachprüfbar bleibt.

01 Das Modell

Der Flight. Und Evidenz als Datenstruktur.

Reifemarker: Gebaut

1.1 Erst die Einheit, dann die Zahlen

Ein Flight ist eine geschlossene Rechercheoperation. Ein Briefing-Satz geht hinein. Wellenweise laufen isolierte Agentenläufe parallel. Danach folgen Gegenprüfung, Synthese und Produktion. Heraus kommen fertige Dokumente, die sämtliche Prüfschwellen grün durchlaufen haben.

Nicht ein Lauf. Nicht eine Suche. Ein Flight.

Die Einheit klingt nach Semantik und ist eine Managemententscheidung. Solange Recherche als „ein Projekt“ oder „ein paar Tage Analystenzeit“ gefasst wird, ist sie weder vergleichbar noch planbar. Mit dem Flight wird sie zählbar: Flights, Läufe, datierte Quellen, Gate-Quote. Was zählbar ist, wird vergleichbar. Was vergleichbar ist, wird planbar und einkaufbar.

Vier Begriffe, die im Rest des Textes tragen:

Die Isolation der Läufe ist kein technisches Detail, sondern eine methodische Bedingung. Zwei Läufe, die sich denselben Kontext teilen, bestätigen einander. Zwei Läufe mit getrenntem Kontext, die zum selben Ergebnis kommen, sind zwei unabhängige Belege. Der Unterschied entscheidet darüber, ob eine Aussage am Ende Konfidenz „hoch“ tragen darf.

1.2 Das Scharnier: Evidenz ist eine Datenstruktur

Hier liegt der Kern, und er wird fast immer übersehen.

In klassischer Recherche ist eine Aussage ein Satz mit einer Fußnote. Bei uns ist eine Aussage ein Datensatz mit sechs Pflichtfeldern.

FeldInhaltWofür es da ist
Behauptungdie Aussage selbst, isoliert formuliertmacht sie einzeln adressierbar
Urheberwer sagt esmacht die Interessenlage einschätzbar
QuelleDokument und Fundstellemacht sie nachprüfbar
Fassungsdatumwelche Version des Dokumentsmacht Alterung messbar
Konfidenzhoch, mittel oder niedrigmacht Belastbarkeit sichtbar
HerkunftsklasseFakt, fremde Prognose, eigene Lesartverhindert stille Vermischung

Diese sechs Felder entstehen nicht am Ende als Dokumentationspflicht. Sie entstehen in der ersten Sekunde jedes Laufs, weil das Regelwerk aus Abschnitt 02 sie erzwingt. Ein Lauf, der eine Aussage ohne vollständige Felder zurückmeldet, hat seine Aufgabe nicht erfüllt.

Der Aufwand dafür ist geringer, als es klingt – und er ist ohnehin unvermeidlich. Jeder gute Analyst hält diese Informationen im Kopf, während er arbeitet. Der Unterschied ist nur, dass sie beim Übergang in den Fließtext verloren gehen. Wir lassen sie nicht verloren gehen.

Die Konsequenz ist die ganze Pointe dieses Artikels. Eine so strukturierte Aussage ist maschinell such-, filter- und vergleichbar. Alles, was in Abschnitt 06 steht – Wiederverwendung über Projekte hinweg, Widerspruchserkennung, Verfallsüberwachung, automatische Konfidenzverdichtung – ist ausschließlich deshalb möglich, weil diese Entscheidung ganz vorne getroffen wurde. Nachträglich lässt sie sich nicht herstellen. Aus 200 Seiten Fließtext bekommt niemand die sechs Felder zurück.

Wer Evidenz als Fließtext produziert, hat sich gegen jede spätere Wiederverwendung entschieden – ohne es zu merken.

02 Das Regelwerk

Zehn Regeln. Jede Aussage muss durch.

Reifemarker: Gebaut

Ein Agent ist ein williger Mitarbeiter ohne Berufserfahrung. Er tut, was man sagt, mit großer Ausdauer und ohne das Unbehagen, das einen erfahrenen Menschen stutzen lässt. Das Regelwerk ersetzt dieses Unbehagen durch explizite Pflichten.

Jede Regel steht hier mit ihrer Begründung und einem anonymisierten Beispiel aus der Praxis, in dem sie gegriffen hat.

Regel 01

Gegenbeleg-Pflicht

Jeder Lauf muss aktiv suchen, was die erwartete Antwort widerlegt. Wer nur bestätigende Belege liefert, hat nicht fertig recherchiert.

Das ist die wichtigste der zehn Regeln, weil sie die gefährlichste Eigenschaft agentischer Systeme adressiert: Sie finden immer etwas. Eine Frage, die eine Antwort nahelegt, bekommt diese Antwort – belegt, zitiert und plausibel. Ohne erzwungene Gegensuche ist das keine Recherche, sondern eine Bestätigungsmaschine mit Quellenapparat.

Aus der Praxis Eine Fragestellung zur Markteintrittsdynamik eines Herstellersegments lieferte in der ersten Runde ein geschlossen wirkendes Bild. Die erzwungene Gegensuche fand belastbare Hinweise auf eine gegenläufige Entwicklung in zwei Teilmärkten. Beides steht im Dokument. Das Ergebnis war unschärfer und richtiger.

Regel 02

Fassungsdatum statt Abrufdatum

Bei Rechtstexten, Verträgen und Normen zählt die Fassung, nicht der Tag des Zugriffs. Eine Recherche auf dem Ursprungstext ist formal korrekt und praktisch falsch, wenn eine Änderungsfassung existiert.

Aus der Praxis Ein Lauf belegte eine regulatorische Frist sauber mit Quelle und Abrufdatum. Die zitierte Fassung war zwischenzeitlich geändert worden. Der Abruf war aktuell, die Information überholt. Seitdem ist das Fassungsdatum ein Pflichtfeld, und eine Aussage ohne Fassungsangabe erreicht nie Konfidenz „hoch“.

Regel 03

Zwölf-Monats-Regel

Quellen, die älter als zwölf Monate sind, werden gekennzeichnet und nur verwendet, wenn nichts Neueres existiert.

Die Regel ist bewusst grob. Sie soll nicht Alter bestrafen, sondern Unachtsamkeit sichtbar machen. In schnell bewegten Feldern ist eine zwei Jahre alte Quelle ein Warnsignal; in Rechtsfragen kann sie die einzig richtige sein. Die Kennzeichnung zwingt zur bewussten Entscheidung statt zur stillen Übernahme.

Regel 04

Dreistufige Konfidenz an jeder Aussage

Hoch, mittel, niedrig. „Hoch“ nur bei einer Primärquelle oder zwei voneinander unabhängigen Belegen.

Die Dreistufigkeit ist Absicht. Zwei Stufen laden zum Schwarz-Weiß ein, fünf Stufen erzeugen Scheingenauigkeit. Drei Stufen zwingen zu einem Urteil, das man auch begründen kann.

Regel 05

Herkunftsnotation

Jede Aussage trägt ihre Klasse: Fakt, fremde Prognose mit genanntem Urheber, oder eigene Lesart.

Die häufigste stille Fehlleistung in Strategiepapieren ist die Vermischung dieser drei. Ein Satz beginnt mit einer belegten Zahl, setzt mit einer fremden Prognose fort und endet in einer eigenen Schlussfolgerung – alles in derselben Tonlage. Wer das liest, kann nicht mehr unterscheiden, was er glauben muss und was er prüfen darf.

Regel 06

Negativbefund ist ein vollwertiges Ergebnis

Ein belegtes „gibt es nicht“ schlägt jede geschätzte Zahl.

Negativbefunde sind teuer zu erarbeiten und werden fast nie dokumentiert, weil sie sich wie ein Scheitern anfühlen. Tatsächlich sind sie oft das wertvollste Ergebnis eines Laufs: Sie schließen einen Suchraum. Wer weiß, dass eine Information nicht öffentlich existiert, spart sich und allen Nachfolgenden die Suche.

Regel 07

Kein Schätzen

Eine nicht auffindbare Größe wird als Lücke ausgewiesen, nie überbrückt.

Diese Regel ist die unbeliebteste, weil sie Dokumente unvollständig aussehen lässt. Genau das ist ihr Zweck. Eine ausgewiesene Lücke ist eine Information. Eine plausibel wirkende Schätzung ohne Kennzeichnung ist eine Falle, die irgendwann jemand als Fakt weiterzitiert.

Regel 08

Anbietermaterial wird gekennzeichnet

Whitepaper, Fallstudien und Pressemitteilungen von Anbietern belegen Positionierung, nicht Marktrealität.

Sie sind damit nicht wertlos – Positionierung ist eine relevante Information. Sie dürfen nur nie als Beleg für Marktgrößen, Verbreitung oder Wirksamkeit durchgehen. Dieser Text hier fällt übrigens in dieselbe Kategorie, und wir sagen es in Abschnitt 07 noch einmal ausdrücklich.

Regel 09

Widerspruchsliste je Dokument

Wo Quellen sich widersprechen, steht es im Dokument – nicht in der Fußnote und nicht im Anhang.

Widersprüche sind das Gegenteil eines Makels. Sie sind der Ort, an dem entweder ein Quellenfehler oder eine echte Bewegung sichtbar wird. Ein Dokument ohne Widerspruchsliste behauptet implizit, die Welt sei einig. Das ist sie nie.

Regel 10

Quellenkatalog je Dokument

Durchnummeriert, mit Urheber, Fundstelle, Datum, Fassung und Konfidenz.

Der Katalog ist die maschinenlesbare Rückseite des Dokuments. Er ist der Grund, warum aus einem fertigen Text später wieder Daten werden können.

Was die zehn Regeln wirklich sind

Sie sehen aus wie eine Qualitätsinitiative. Sie sind eine Betriebsvoraussetzung.

Parallelität ohne Regelwerk erzeugt nicht mehr Erkenntnis, sondern dreimal so schnell dreimal so viel Plausibles. Die Prüfregeln sind das, was Geschwindigkeit überhaupt erst verantwortbar macht. Wer sie weglässt, hat kein schnelleres Research – er hat ein schnelleres Risiko.

Das Regelwerk ist nicht der Preis der Geschwindigkeit. Es ist seine Voraussetzung.

03 Der Stack und seine Gates

Sieben Schichten. Zwei Prüflinien.

Reifemarker: Gebaut

3.1 Sieben Schichten

SchichtFähigkeitTooling
Orchestrierungisolierte Ausführungskontexte, parallele Lastverteilung, ereignisbasierte Fertigmeldung — keine Wartezyklen, keine Leerkosten—
ModellGroßkontext-Träger mit einer Million Token für die Rohrecherche; starkes Synthesemodell für Gegenprüfung und ReviewMoonshot, Anthropic
Suchemehrere umschaltbare Quellenkanäle: synthetisierende Websuche, breite Indexsuche, neuronale Ähnlichkeitssuche, Echtzeit-News- und FinanzkanalPerplexity, Brave
Extraktiongezielte Feldextraktion aus Primärdokumenten im Volltext — Einkaufsbedingungen, Anleiheprospekte, Rechtstexte, Investorenunterlagen—
ProduktionDokumenterstellung mit Formatvorlage, Ablage, Versionierung, FreigabeWorkspace (SharePoint, Google Docs etc.)
SatzAusgabe der freigegebenen Inhalte in die Zielformate—
Wissenpersistente Projektakte und Arbeitsgedächtnis — der Arbeitsstand überlebt Sitzungsende und ModellwechselDatenbank (Chroma, SQLite, Notion etc.)

Zwei Schichten verdienen eine Erläuterung, weil sie den Unterschied zu üblichen Rechercheaufbauten ausmachen.

Die Extraktionsschicht greift auf Primärdokumente im Volltext zu, statt sich auf das zu verlassen, was eine Suchmaschine daraus zitiert hat. Einkaufsbedingungen, Anleiheprospekte, Rechtstexte und Investorenunterlagen sind genau die Dokumente, die in Sekundärberichten am stärksten verkürzt werden – und genau die, in denen die entscheidenden Details stehen. Wer sie nur über Zitate kennt, kennt sie nicht.

Die Wissensschicht sorgt dafür, dass ein Arbeitsstand nicht an eine Sitzung gebunden ist. Das klingt nach Komfort und ist eine Kostenfrage: Ein Verfahren, das bei jeder Unterbrechung den gesamten Kontext neu aufbauen muss, ist in längeren Vorhaben nicht wirtschaftlich zu betreiben.

Der wichtigste Satz zu dieser Tabelle steht nicht darin. Keine dieser Schichten ist ein Wettbewerbsvorteil. Jede ist einkaufbar, die meisten innerhalb eines Tages, und jede ist austauschbar – die Spalte Tooling ist eine Momentaufnahme, keine Festlegung. Der Vorteil entsteht ausschließlich durch das, was zwischen den Schichten steht.

3.2 Zwei Gate-Linien

Vorne

Das Datenschutz-Gate

Kundenneutrale Auftragsprompts. Kein Kundenname, kein Projektbezug, kein Auftragsverhältnis in irgendeinem Lauf. Die Rechercheaufgabe wird so formuliert, dass sie für sich steht: eine Branchenfrage, keine Mandantenfrage.

Was nach Compliance-Pflicht aussieht, ist in Wahrheit ein Preisvorteil. Erst die Neutralität erlaubt es, die Rohrecherche auf dem günstigeren Modellpfad zu fahren, während Synthese und Gegenprüfung auf dem teureren laufen. Ohne das Gate müsste jeder Lauf auf dem Pfad mit den strengeren Datenzusagen stattfinden. Datenschutz spart hier Geld, statt welches zu kosten – und das ist kein Nebeneffekt, sondern die Bedingung dafür, dass elf Läufe in einem Flight wirtschaftlich sind.

Hinten

Das Evidenz-Gate

Bevor ein Dokument freigegeben wird, läuft eine Vollständigkeitsprüfung gegen das Regelwerk aus Abschnitt 02. Sie stellt fünf Fragen an jedes Dokument:

Nur grün wird freigegeben. Ein rotes Gate ist kein Hinweis, sondern ein Stopp.

Dass daneben noch formale Produktionsprüfungen laufen – Satz, Format, Gestaltung – ist selbstverständlich und gehört ausdrücklich nicht zur Methode. Wie ein Dokument aussieht, sagt nichts darüber, ob seine Aussagen tragen.

Das Prinzip hinter beiden Linien: Qualitätskosten werden nicht gesenkt, sie werden nach vorne verlegt. Ein Gate ist billiger als eine Korrekturschleife – und es wird nicht müde, nicht nachlässig und nicht betriebsblind.

Werkzeuge kauft jeder. Den Unterschied machen die Schwellen dazwischen.

04 Ein reales Beispiel in zwei Flights

Was tatsächlich geflogen wurde.

Reifemarker: Gebaut

In einem einzigen Industrie-Strategie-Mandat, Q3 2026, liefen zwei aufeinander aufbauende Flights.

22
Dokumente
Arbeitsdokumente und Ausgabedokumente, über beide Flights.
~96.000
Wörter
geprüfte Evidenz, die vollständige Basis beider Flights.
~640
Quellen
einzeln datiert, allein in Flight 2. Jede mit Urheber, Fassung und Konfidenz.
< 6 h
Laufzeit
reine Laufzeit für die acht Research-Briefings in Flight 2 — von der Freigabe bis zum letzten abgelegten Dokument.
22/22
Freigabeprüfung
Dokumente haben sie im ersten Durchlauf bestanden. Null Nacharbeit.

Flight 1 — die Kartierung

Der erste Flight war ein Breitensuchlauf. Die Aufgabe lautete nicht, eine Frage zu beantworten, sondern ein Feld zu vermessen: Welche Kräfte wirken, welche Quellen gibt es überhaupt, wo ist die Faktenlage dicht und wo dünn.

12 Subagenten, jeder mit eigener Teilfrage und eigenem isoliertem Kontext, lieferten zwölf voneinander unabhängige Tiefenbohrungen – rund 48.000 Wörter Evidenz. Ergebnis war kein fertiges Argument, sondern eine belastbare Landkarte: bestätigte Zusammenhänge, offene Widersprüche und, am wertvollsten, eine erste Lückenkarte.

Genau diese Lückenkarte wurde zum Briefing für Flight 2. Das ist der Mechanismus aus Abschnitt 06, hier zum ersten Mal in klein: Der zweite Flight startete nicht bei null, sondern bei dem, was der erste offen gelassen hatte.

Das Kostenmodell hinter den 12 Subagenten

Zwölf parallele Agentenläufe sind nur dann wirtschaftlich, wenn nicht jeder von ihnen auf dem teuersten Modell läuft. Deshalb bekommt jeder Lauf das Modell, das seine Aufgabe verlangt – eine Triage in drei Stufen:

AufgabentypModellstufeWarum
Beschaffung und Extraktion — Dokumente holen, Felder herauslösen, Listen bauengünstigmechanische Arbeit, kaum Urteil nötig
Rohrecherche — große Quellenmengen sichten und zusammenführenGroßkontextVolumen schlägt Finesse; ein Million-Token-Fenster ersetzt zwanzig Teilschritte
Synthese, Gegenprüfung, Review — Widersprüche bewerten, Konfidenz vergebenstarkhier entsteht das Urteil, hier wird nicht gespart

Die Triage ist der eigentliche Grund, warum die Zahlen oben überhaupt erreichbar sind. Wer alles auf dem stärksten Modell fährt, bekommt dieselbe Qualität zu einem Vielfachen des Preises – und wer alles auf dem günstigsten fährt, bekommt schnelle Plausibilität ohne Urteilskraft. Erst das Datenschutz-Gate aus Abschnitt 03 macht die mittlere Stufe überhaupt benutzbar.

Flight 2 — die Tiefe

Elf Agentenläufe: drei Wellen zu je drei, plus zwei Auswertungsläufe. Maximal drei gleichzeitig. Jeder Lauf mit eigenem, vollständig isoliertem Kontext – kein Lauf konnte einen anderen beeinflussen, und zwei Läufe, die unabhängig zum selben Ergebnis kamen, zählten als zwei Belege. Ergebnis: über 200 Seiten.

Die Begrenzung auf drei parallele Läufe ist bewusst gesetzt. Mehr Parallelität ist technisch möglich und methodisch sinnlos: Die Auswertungsläufe brauchen vollständige Vorergebnisse, und Wellen erlauben es, nach jeder Runde nachzusteuern. Ein Flight ist kein Dauerlauf, sondern eine Taktung.

Warum die Zahlen nicht das Beeindruckende sind

Erstens – Dichte statt Dump. 640 Quellen sind keine Trefferliste. Primärdokumente wurden im Volltext ausgewertet, nicht als Sekundärzitat übernommen. Jede Quelle trägt ihre sechs Felder. Der Unterschied zwischen 640 Links und 640 geprüften Belegen ist der Unterschied zwischen Material und Evidenz.

Zweitens – Konsistenz skaliert mit. Dokument 22 hat dieselbe Prüfschärfe wie Dokument 1. In menschlicher Arbeit sinkt die Sorgfalt mit der Stunde, und zwar zuverlässig; wer schon einmal eine Nacht an einem Due-Diligence-Dokument gesessen hat, weiß das. Geschwindigkeit ist hier nicht der eigentliche Gewinn. Gleichmäßigkeit ist es.

Drittens – 22 von 22 im ersten Durchlauf. Keine Korrekturschleife, kein zweiter Anlauf. Das ist der Teil, den ihr in Angeboten nie seht, weil Nacharbeit selten jemand ausweist.

Die Einordnung, offen gekennzeichnet

Ein vergleichbarer Rechercheumfang in klassischer Aufstellung – Primärquellen im Volltext, durchgängig datiert, mit Konfidenzstufe, Widerspruchsliste und Quellenkatalog je Dokument – ist eine Sache von Analystenwochen, nicht von Stunden.

Diesen Vergleich kennzeichnen wir als eigene Lesart, nicht als Messung. Wir haben kein Kontrollteam mitlaufen lassen, und wir behaupten keine Zahl, die wir nicht erhoben haben. Genau das verlangt unser Regelwerk von jeder Aussage, und es gilt auch für diesen Text. Wer seine Methode verkauft, muss sie zuerst auf den eigenen Satz anwenden.

Nicht die Stunden sind das Ergebnis. Die null Nacharbeit ist es.

05 Vier unbequeme Wahrheiten

Was über agentische Recherche selten gesagt wird.

Reifemarker: eigene Lesart
Wahrheit 01

Tempo ist das billigste Versprechen

Geschwindigkeit kann inzwischen jeder Anbieter einlösen, und sie sagt nichts über Nachprüfbarkeit. Sie ist leicht zu demonstrieren, leicht zu glauben und leicht zu verkaufen.

Wer Tempo in den Mittelpunkt stellt, verkauft die einfachere Hälfte der Aufgabe und schweigt über die schwierigere. Die relevante Frage an jeden Anbieter lautet nicht, wie schnell er liefert, sondern was passiert, wenn eine seiner Aussagen in sechs Monaten angezweifelt wird.

Wahrheit 02

Agenten sind Bestätigungsmaschinen, solange man sie lässt

Ein Agent, der eine Frage bekommt, findet fast immer eine Antwort. Das ist seine Stärke und seine gefährlichste Eigenschaft. Formuliert eine Frage, die eine These nahelegt, und ihr erhaltet diese These – mit Quellen, in gutem Deutsch, in zwei Minuten.

Der teuerste Fehler ist deshalb nie die offensichtlich falsche Antwort. Die fällt auf. Es ist die plausible, gut belegte, einseitig recherchierte Antwort, die in eine Vorstandsvorlage wandert und dort zur Grundlage einer Investitionsentscheidung wird.

Die Gegenbeleg-Pflicht ist keine methodische Feinheit. Sie ist die einzige wirksame Gegenmaßnahme.

Wahrheit 03

Die meisten KI-Recherchen zitieren die falsche Fassung

Ursprungstexte sind besser indexiert, häufiger verlinkt und öfter zitiert als ihre Änderungsfassungen. Ein Modell, das nach der wahrscheinlichsten Fundstelle sucht, findet also zuverlässig das, was einmal galt.

Das Ergebnis ist formal einwandfrei: korrekte Quelle, korrektes Zitat, aktuelles Abrufdatum. Und es ist praktisch wertlos. Bei Rechtstexten, Einkaufsbedingungen, Normen und Verträgen ist das kein Detail, sondern der ganze Unterschied zwischen einer belastbaren und einer gefährlichen Aussage.

Wahrheit 04

Datenschutz wird als Kostenstelle verbucht und ist ein Preisvorteil

In den meisten Organisationen gilt Datenschutz bei KI-Projekten als Bremse: ein Prüfschritt, der Zeit kostet und Möglichkeiten einschränkt.

In einem sauber aufgesetzten Rechercheverfahren ist das Gegenteil der Fall. Kundenneutrale Aufgabenstellungen sind die Eintrittskarte in den günstigeren Modellpfad für die Rohrecherche. Wer Mandantenkontext in jeden einzelnen Lauf kippt, zahlt doppelt – im Risiko und im Preis. Die Neutralität ist nicht die Auflage, die den Betrieb verteuert. Sie ist die Bedingung, die ihn überhaupt wirtschaftlich macht.

Fragt euren Rechercheanbieter nicht, wie schnell er ist. Fragt ihn, wonach er gesucht hat, um sich selbst zu widerlegen.

CRAiD Design Research
06 Von zwei Flights zur Flotte

Was entsteht, wenn Evidenz nicht mehr verfällt.

Reifemarker: 6.1 Gebaut · 6.2 In Bau · 6.3 und 6.4 Entwurf

6.1 Die Mengenseite, und warum sie die langweilige ist

Rechnen wir hoch. Zehn Flights zu je elf Läufen: 110 isolierte Rechercheläufe, grob 6.400 datierte Quellen, rund 480.000 Wörter geprüfte Evidenz, über 100 Dokumente, etwa 2.000 Seiten.

Das ist eine beeindruckende Zahl und für sich genommen wertlos. Zweitausend Seiten in einem Laufwerk sind kein Wissen, sondern ein Ablageproblem. Niemand liest sie, niemand findet darin etwas wieder, und in achtzehn Monaten weiß niemand mehr, welche Hälfte davon noch stimmt.

Masse ist nicht der Punkt. Struktur ist der Punkt.

6.2 Der Unterschied

Die Evidenz landet nicht als Dokument, sondern als Vektor-Index. Jede Aussage eine eigene Einheit, mit den sechs Feldern aus Abschnitt 01 als Metadaten. Suchbar nach Bedeutung statt nach Stichwort, filterbar nach Fassungsdatum, Konfidenz und Herkunftsklasse.

Damit hört der Korpus auf, eine Sammlung von Dokumenten zu sein, und wird ein abfragbarer Bestand. Das Prinzip legen wir offen; die Umsetzung – Schema, Indexparameter, Routing – bleibt bei uns. Wer das Prinzip verstanden hat, kann es nachbauen. Das ist beabsichtigt.

6.3 Sieben Effekte

Effekt 01

Wiederverwendung statt Neurecherche

Eine neue Frage trifft zuerst auf das, was längst belegt ist. Flight drei startet nicht bei null, sondern bei „das wissen wir, das fehlt“. Der teuerste Teil jeder Recherche – die Grundlagenarbeit, die jedes Mal wieder dieselbe ist – fällt beim zweiten Mal weg.

Effekt 02

Widerspruchserkennung über Flights hinweg

Flight 3 sagt X. Flight 7 sagt Nicht-X. Der Korpus sieht das, ein Mensch nie – die beiden Aussagen stehen in verschiedenen Dokumenten, aus verschiedenen Monaten, für verschiedene Fragestellungen. Jeder solche Widerspruch ist entweder ein Quellenfehler oder eine echte Marktbewegung. Beides wollt ihr wissen, und zwar früh.

Effekt 03

Verfallsüberwachung

Jede Aussage kennt ihre Fassung. Der Bestand kann deshalb selbst melden, welche Grundlagen altern. Eine Studie, die sich meldet, wenn sie überholt ist – das ist der Punkt, an dem Research aufhört, ein Datum zu haben.

Effekt 04

Automatische Konfidenzverdichtung

Belegen zwei unabhängige Flights dasselbe, steigt die Konfidenz dieser Aussage von mittel auf hoch. Die Evidenz verdichtet sich ohne jede zusätzliche Arbeit, allein dadurch, dass weiter gearbeitet wird.

Effekt 05

Negativbefund-Register

Belegte Nicht-Existenzen sind teuer zu erarbeiten und werden nirgends dokumentiert. Im Korpus sind sie auffindbar. Niemand sucht zweimal vergeblich nach derselben Zahl.

Effekt 06

Lückenkarte

Der Bestand zeigt, wo nichts steht. Research-Planung wird damit ableitbar statt intuitiv: Ihr seht, in welchen Feldern die Konfidenz niedrig ist, wo Quellen altern und wo schlicht nichts liegt. In klein hat das bereits zwischen Flight 1 und Flight 2 funktioniert.

Effekt 07

Briefing-Generierung

Aus der Lückenkarte entstehen die nächsten Research-Fragen von selbst. Der Kreis schließt sich: Der Bestand sagt, was als Nächstes zu untersuchen ist, und wächst an genau der Stelle, an der er dünn war.

6.4 Der Umschlagpunkt

Etwa ab dem dritten Flight in einer Domäne kippt die Ökonomie: Wiederverwendung schlägt Neurecherche. Von da an sinken die Kosten je Erkenntnis mit jedem weiteren Flight, statt konstant zu bleiben.

Das ist die eigentliche These dieses Artikels, in einer Zahl: Research hört auf, ein wiederkehrender Kostenposten zu sein, und wird ein Vermögenswert. Einer, der bei euch bleibt und nicht beim Dienstleister.

Belegt ist dieser Pfad bis Flight 2. Alles darüber hinaus ist Architektur und Roadmap, und wir kennzeichnen es als das. Es wäre der leichteste Satz dieses Textes, hier eine Zahl zu behaupten, die niemand nachprüfen kann. Regel 7 verbietet ihn.

Die Frage ist nicht, was eine Studie kostet. Die Frage ist, ob die zehnte Studie billiger ist als die erste.

07 Grenzen, Reifegrad und Selbsttest

Was das Verfahren nicht kann – und wo ihr steht.

Reifemarker: gemischt

7.1 Vier ehrliche Grenzen

Grenze 01

Keine Primärforschung am Menschen

Interviews, Beobachtung, Feldzugang, Nutzerforschung im eigentlichen Sinne bleiben menschliche Arbeit. Was hier beschrieben ist, ist Schreibtischrecherche in hoher Dichte – nicht mehr und nicht weniger.

Grenze 02

Konfidenz „hoch“ ist nicht Wahrheit

Zwei unabhängige Quellen können gemeinsam irren, und bei verbreiteten Fehlannahmen tun sie es zuverlässig. Die Konfidenzstufe misst die Belegbarkeit, nicht die Richtigkeit.

Grenze 03

Der Korpus erbt die blinden Flecken seiner Quellen

Was nirgends publiziert ist, bleibt unsichtbar. Die Lückenkarte zeigt es immerhin an, statt es zu verschleiern – aber sie füllt die Lücke nicht.

Grenze 04

Das Verfahren ersetzt kein Urteil

Es liefert die Grundlage, auf der ein Urteil verantwortbar wird. Die Entscheidung bleibt bei Menschen, und sie sollte es bleiben.

In eigener Sache

Und dieser Text selbst fällt unter Regel 8: Er ist Anbietermaterial. Er belegt unsere Positionierung und Arbeitsweise, nicht den Markt.

7.2 Reifegradmodell

StufeZustandWoran ihr es erkennt
0 — Ad-hocRecherche als EinzelleistungDie Qualität hängt an der Person, die es gemacht hat
1 — RegelwerkEvidenzregeln sind schriftlich und verbindlichJede Aussage trägt Konfidenz und Herkunft
2 — GatesPrüfschwellen laufen automatisch, nicht nach ErinnerungKein Dokument wird ohne grünes Gate freigegeben
3 — EvidenzvermögenDer Bestand ist maschinenlesbar und wiederverwendbarDer nächste Auftrag startet nicht bei null

Die Stufen sind nicht überspringbar. Ein Vektor-Index über unstrukturierter Evidenz ist eine teure Volltextsuche. Stufe 3 funktioniert nur auf Stufe 1 und 2 – und Stufe 1 kostet keine Technologie, sondern eine Entscheidung.

7.3 Selbsttest in fünf Fragen

Wenn ihr drei oder mehr nicht klar beantworten könnt, arbeitet ihr auf Stufe 0 oder 1.

  1. Könnt ihr zu einer beliebigen Aussage in eurer letzten Studie Urheber, Fassungsdatum und Konfidenzstufe nennen – in unter einer Minute?
  2. Gibt es in euren Research-Dokumenten eine Stelle, an der steht, was ihr nicht gefunden habt?
  3. Wurde in eurem letzten Rechercheauftrag aktiv nach dem Gegenbeleg gesucht – und steht das Ergebnis im Dokument?
  4. Weiß irgendjemand bei euch, welche Aussagen eurer bestehenden Studien heute veraltet sind?
  5. Beginnt euer nächster Rechercheauftrag bei null – oder bei dem, was ihr bereits belegt habt?

Reifegrad 3 ist kein Technologieprojekt. Er beginnt damit, dass jede Aussage ihre sechs Felder trägt.

— Methodennotiz

Woher die Zahlen stammen.

Woher die Zahlen stammen. Alle Kennzahlen in Abschnitt 04 stammen aus zwei agentischen Rechercheoperationen innerhalb eines Industrie-Strategie-Mandats im dritten Quartal 2026. Auftraggeber, Branche im engeren Sinne, Fragestellungen und Dokumentinhalte sind nicht Gegenstand dieses Textes und werden es nicht.

Wie anonymisiert wurde. Die Zahlen sind unverändert; der Kontext ist entfernt. Die Praxisbeispiele im Regelwerk sind so abstrahiert, dass die zugrunde liegende Fragestellung nicht rekonstruierbar ist.

Was ausdrücklich nicht gemessen wurde. Wir haben keinen Vergleichslauf in klassischer Aufstellung durchgeführt. Jede Aussage dieses Textes zur relativen Geschwindigkeit ist als eigene Lesart gekennzeichnet und nicht als Messung zu lesen. Ebenso wenig haben wir die inhaltliche Treffsicherheit gegen ein unabhängiges Audit geprüft – gemessen ist die Freigabequote, nicht die Wahrheit.

Reifemarker. Gebaut bezeichnet, was in beiden Flights produktiv gelaufen ist. In Bau bezeichnet, was begonnen und nicht abgeschlossen ist. Entwurf bezeichnet Architektur ohne Umsetzung.

— Anhang

Das Regelwerk als Prüfbogen.

Zum Mitnehmen und Anlegen an eure eigene nächste Studie. Jede Zeile ist eine Frage an das fertige Dokument.

  1. Steht im Dokument, wonach gesucht wurde, um die eigene These zu widerlegen?
  2. Trägt jede Quelle aus Recht, Vertrag oder Norm ein Fassungsdatum?
  3. Sind Quellen über zwölf Monate als solche gekennzeichnet?
  4. Trägt jede Aussage eine von drei Konfidenzstufen?
  5. Ist bei jeder Aussage erkennbar, ob sie Fakt, fremde Prognose oder eigene Lesart ist?
  6. Sind Negativbefunde als Ergebnis ausgewiesen statt weggelassen?
  7. Sind nicht auffindbare Größen als Lücke markiert statt geschätzt?
  8. Ist Anbietermaterial als solches gekennzeichnet?
  9. Gibt es eine Widerspruchsliste im Dokument?
  10. Gibt es einen durchnummerierten Quellenkatalog mit Urheber, Fundstelle, Datum, Fassung und Konfidenz?

Diese Research ist Teil der CRAiD-Reihe „Reports vom agentischen Frontend“. Grundlage: zwei agentische Rechercheoperationen in einem Industrie-Strategie-Mandat, Q3 2026, anonymisiert. Letzter Stand: Oktober 2026.

← Zurück zu Insights