Ridurre contesto ripetuto e token nei flussi di IA legale
Riepiloghi MCP, sintesi dell’ontologia e conclusioni salvate: come Relex limita il contesto superfluo e come misurare i costi.
Perché ripetere tanto contesto?
Ricaricare atti, conversazioni e istruzioni consuma contesto senza aggiungere fatti. Un workspace persistente permette di partire dal lavoro salvato e consultare le fonti necessarie. Non rende gratuita l’elaborazione né elimina i limiti del modello.
Che cosa fa Relex?
MCP espone search ed execute. Search restituisce operazioni pertinenti con parametri compatti invece dell’intero catalogo API. La lettura della pratica è un riepilogo per impostazione predefinita; l’ontologia è una sintesi limitata. I dettagli restano richiedibili. Concludere una sessione di steering salva il risultato nella pratica continuativa.
La fattura diminuisce sempre?
No. Questa architettura può ridurre token di input inutili; non è un benchmark pubblicato. Strumenti, output, ragionamento, letture, cache e uso Relex incidono sul totale. Un abbonamento fisso non diventa necessariamente più economico. La de-identificazione protegge identità, non è una tecnica di compressione dei token.
Come misurare il beneficio?
Usa stessa pratica autorizzata o sintetica, compito, modello e obiettivo su più sessioni. Confronta caricamento integrale ripetuto e riepiloghi con letture mirate. Registra input, cache, output, ragionamento dichiarato, chiamate, latenza, costi e risultati mancanti o non supportati. Includi preparazione e ogni lettura. Mantieni fonti e controllo umano.