Réduire le contexte répété et les tokens en IA juridique

Résumés MCP, extraits d’ontologie et conclusions sauvegardées : comment Relex limite le contexte inutile et comment mesurer le coût.

Pourquoi répéter autant de contexte ?

Recharger les pièces, rejouer les conversations et reconstruire les instructions consomme du contexte sans faits nouveaux. Un espace persistant permet de partir du travail enregistré et de consulter les sources nécessaires. Il ne rend pas le traitement gratuit et ne supprime pas les limites des modèles.

Que fait Relex ?

MCP expose search et execute. Search renvoie les opérations pertinentes et leurs paramètres compacts plutôt que tout le catalogue API. Un dossier est lu par défaut en résumé, non avec toute sa chronologie ; l’ontologie fournit un extrait borné. Les détails restent accessibles. Conclure une session de pilotage enregistre son résultat dans le dossier continu.

La facture baisse-t-elle forcément ?

Non. Cette architecture peut limiter les tokens d’entrée inutiles ; ce n’est pas un benchmark publié. Outils, sorties, raisonnement, lectures, cache du fournisseur et usage Relex influencent le total. Un abonnement forfaitaire ne devient pas nécessairement moins cher. La dé-identification protège les identités ; ce n’est pas une compression de tokens.

Comment mesurer le bénéfice ?

Gardez dossier autorisé ou synthétique, tâche, modèle et objectif identiques sur plusieurs sessions. Comparez chargement intégral répété et résumés avec lectures ciblées. Mesurez entrées, cache, sorties, raisonnement déclaré, appels, latence, coût total et éléments manquants ou non étayés. Incluez préparation et toutes les lectures. Préservez accès aux sources et contrôle humain.