Date a un modello un documento di cento pagine e chiedetegli qualcosa a pagina cinquanta: potrebbe non trovare la risposta — non perché il dato non sia nel contesto, ma per la posizione in cui si trova.
TL;DR
- Gli LLM sfruttano l’inizio e la fine di un contesto lungo molto meglio del centro.
- L’effetto ha forma a U e compare anche nei modelli costruiti esplicitamente per il contesto lungo.
- Far entrare le informazioni nella finestra non equivale a far sì che il modello le utilizzi.
La promessa, e l’inganno
Le finestre di contesto più ampie vendono un’idea allettante: basta incollare tutto e lasciare che il modello ci si raccapezzi. Nessun recupero, nessuna struttura — un unico prompt gigantesco. Ma c’è un divario tra l’avere un’informazione nella finestra e il fatto che il modello la utilizzi davvero, e quel divario cresce con la lunghezza.
Cosa dimostra la ricerca
In Lost in the Middle: How Language Models Use Long Contexts, Liu e colleghi hanno misurato quanto bene i modelli trovino e utilizzino un’informazione a seconda della sua posizione nell’input. Hanno costruito due test deliberatamente controllati:
- QA multi-documento. Il modello riceve una domanda e una pila di documenti — 10, 20 o 30 — dove esattamente uno contiene la risposta. Quel documento «d’oro» viene fatto scorrere in ogni posizione della pila e l’accuratezza viene misurata in ciascun punto.
- Recupero chiave–valore. Un test sintetico privo di rumore linguistico: un lungo oggetto JSON di centinaia di coppie chiave–valore casuali, dove il modello deve restituire il valore di una chiave specificata — isolando la pura ricerca basata sulla posizione dalla comprensione.
In entrambi i compiti, e sia nei modelli aperti sia in quelli chiusi (GPT-3.5-Turbo, Claude, MPT-30B-Instruct, LongChat-13B), è emersa la stessa forma: l’accuratezza è massima quando l’elemento rilevante è vicino all’inizio o alla fine del contesto e cala quando il modello deve raggiungerlo nel centro — una curva a U.
Le prestazioni sono spesso più elevate quando l’informazione rilevante si trova all’inizio o alla fine del contesto in input, e si degradano in modo significativo quando i modelli devono accedervi nel centro.
Tre dettagli rendono la cosa peggiore di quanto sembri a prima vista. Vale anche per i modelli costruiti per il contesto lungo — una finestra più ampia non significa che il modello la legga in modo uniforme. Nel caso peggiore (quello centrale), l’accuratezza multi-documento può scendere al di sotto della baseline a libro chiuso— lo stesso modello che risponde senza alcun documento, basandosi solo sui propri parametri. E fornire a un modello la versione a contesto esteso di se stesso non ha dato alcun vantaggio quando l’input rientrava già nella finestra più piccola: la capacità aggiuntiva non ha comprato nulla.
Una mitigazione ha spostato l’ago: la contestualizzazione consapevole della domanda — ripetere la domanda sia prima sia dopo i documenti. Ha quasi risolto il compito sintetico chiave–valore, ma ha aiutato a malapena il QA multi-documento reale, quindi non è una cura generale. È la posizione, non la semplice presenza, ciò a cui il modello è sensibile.
Cosa significa per te
Se ti affidi a incollare una lunga cronologia, un grande documento o un intero progetto in una chat, la qualità della risposta del modello dipende in parte dalla fortuna — da dove è capitato il passaggio rilevante. Man mano che il contesto cresce, il «centro» che viene letto poco cresce con esso. Due implicazioni pratiche:
- Metti in evidenza, non seppellire. Il materiale rilevante dovrebbe raggiungere il modello come un passaggio breve e ben collocato — non essere nascosto nel mezzo di un muro di testo.
- La struttura batte il volume. Organizzare e recuperare i pezzi giusti in modo coerente supera costantemente la speranza che una finestra più grande li legga tutti.
Dove si colloca FocusLM
È esattamente per questo che FocusLM conserva il tuo materiale come una memoria strutturata anziché come un registro di chat sempre più lungo. Invece di ammassare tutto in un unico contesto sperando che il centro venga letto, archivia ciò che gli fornisci e fa emergere i pezzi rilevanti e citati quando lo chiedi — così la risposta è ancorata al materiale giusto, ovunque esso sia originariamente nato.