Ridurre contesto ripetuto e token nei flussi di IA legale

Riepiloghi MCP, sintesi dell’ontologia e conclusioni salvate: come Relex limita il contesto superfluo e come misurare i costi.

Perché ripetere tanto contesto?

Ricaricare atti, conversazioni e istruzioni consuma contesto senza aggiungere fatti. Un workspace persistente permette di partire dal lavoro salvato e consultare le fonti necessarie. Non rende gratuita l’elaborazione né elimina i limiti del modello.

Che cosa fa Relex?

MCP espone search ed execute. Search restituisce operazioni pertinenti con parametri compatti invece dell’intero catalogo API. La lettura della pratica è un riepilogo per impostazione predefinita; l’ontologia è una sintesi limitata. I dettagli restano richiedibili. Concludere una sessione di steering salva il risultato nella pratica continuativa.

La fattura diminuisce sempre?

No. Questa architettura può ridurre token di input inutili; non è un benchmark pubblicato. Strumenti, output, ragionamento, letture, cache e uso Relex incidono sul totale. Un abbonamento fisso non diventa necessariamente più economico. La de-identificazione protegge identità, non è una tecnica di compressione dei token.

Come misurare il beneficio?

Usa stessa pratica autorizzata o sintetica, compito, modello e obiettivo su più sessioni. Confronta caricamento integrale ripetuto e riepiloghi con letture mirate. Registra input, cache, output, ragionamento dichiarato, chiamate, latenza, costi e risultati mancanti o non supportati. Includi preparazione e ogni lettura. Mantieni fonti e controllo umano.