Antworten aus Ihrem Archiv, auf die Sie sich verlassen können
Für Ihre Mitarbeiter zählt am Ende eine Frage: Wo steht die Antwort, und stimmt sie? Unser Archivsystem liefert genau das, eine belegte Antwort aus Ihren eigenen Dokumenten, mit einem Klick auf die Fundstelle. Findet es keinen Beleg, sagt es das offen, statt zu raten. So wird aus einem über Jahre gewachsenen Aktenberg eine Wissensquelle, der Ihr Team vertraut, ob in Kanzlei, Verwaltung, Redaktion oder Fachabteilung. Wie wir diese Verlässlichkeit technisch absichern, beschreiben wir hier bewusst offen.
Ein Archivsystem ist nur so gut wie der Beleg hinter jeder Antwort. Wir trennen deshalb das Finden vom Antworten. Die Suche kombiniert zwei Verfahren: BM25 für exakte Begriffe, Aktenzeichen und Eigennamen sowie eine Vektorsuche über selbst betriebene Embeddings für inhaltliche Nähe. Beide Trefferlisten führen wir per Reciprocal Rank Fusion zusammen. Ein Cross-Encoder-Reranking verdichtet die besten 50 Kandidaten auf die fünf relevantesten Passagen. Erst diese gehen in die Antwort.
Vor der Ausgabe prüft ein NLI-Satz-Grounding jeden generierten Satz gegen die zitierten Quellen. Findet das Modell keine Stützung, antwortet das System mit nicht gefunden statt zu raten. Diese Abstention ist der Kern: keine erfundenen Fundstellen, keine halluzinierten Aktenzeichen. Die Qualität messen wir mit einem eval_harness und der RAGAS-Metrik Faithfulness, die wir vor jedem Release laufen lassen.
Für die Navigation großer Bestände liefert PageIndex einen Dokumentbaum bis auf Abschnittsebene. Der Wissensgraph verbindet Entitäten, Beziehungen, Pfade und Communities, sodass auch Quervergleiche über tausende Akten möglich werden. Wo Revisionssicherheit gefordert ist, setzen wir den Rahmen aus GoBD, § 147 AO und WORM-Audit-Protokollen um.
- Hybrid-Suche aus BM25 und Vektorsuche mit Rang-Fusion
- Reranking von top-50 auf top-5 vor der Antwort
- Satz-genaues Grounding mit Abstention bei fehlendem Beleg
- PageIndex und Wissensgraph für Struktur und Querbezüge
- Revisionssicherheit nach GoBD und § 147 AO
Im Einsatz ist diese Architektur unter anderem in einem großen KI-Archiv mit Millionen Dokumenten. Gebaut für Archive, Kanzleien, Behörden und Forschung. Die Daten bleiben dabei auf unseren Servern in Deutschland.