Wiederholten Kontext und Token-Verbrauch bei Legal AI reduzieren
Mandatsübersichten, Ontologie-Auszüge und gespeicherte Ergebnisse: Relex-MCP und eine faire Methode zur Messung von Token-Kosten.
Warum benötigt Legal AI immer wieder so viel Kontext?
Erneute Akten-Uploads, lange Chatverläufe und wiederholte Anweisungen verbrauchen Kontext ohne neue Fakten. Ein dauerhafter Workspace ermöglicht den Einstieg über gespeicherte Arbeit und gezielte Quellenabrufe. Speicherung macht Modellverarbeitung nicht kostenlos und beseitigt keine Kontextgrenzen.
Wie reduziert Relex unnötigen Kontext?
MCP bietet search und execute. Search liefert relevante Operationen mit kompakten Parametern statt des gesamten API-Katalogs. Einzelmandate werden standardmäßig als Übersicht statt voller Timeline abgerufen, die Ontologie als begrenzter Auszug. Details bleiben abrufbar. Der Abschluss einer Steering-Sitzung speichert Ergebnisse im fortlaufenden Mandatskontext.
Ist eine niedrigere Rechnung garantiert?
Nein. Die Architektur kann unnötige Eingabe-Tokens reduzieren, ist aber kein veröffentlichter Benchmark. Werkzeugaufrufe, Ausgabe- und Reasoning-Nutzung, Quellenabrufe, Caching und Relex-Nutzung beeinflussen die Gesamtkosten. Ein Festpreisabo wird nicht automatisch günstiger. De-Identifizierung schützt Identitäten, komprimiert aber nicht automatisch Tokens.
Wie messen Kanzleien den Nutzen?
Vergleichen Sie mit demselben autorisierten oder synthetischen Mandat, Auftrag, Modell und Ausgabeziel mehrere Sitzungen: vollständigen Kontext wiederholt laden oder Übersicht plus gezielte Abrufe nutzen. Erfassen Sie Eingabe, Cache, Ausgabe, gemeldete Reasoning-Tokens, Aufrufe, Laufzeit, Gesamtkosten und unbelegte oder fehlende Ergebnisse. Zählen Sie Einrichtung und alle Abrufe mit. Quellenprüfung und fachliche Kontrolle bleiben erhalten.