L’intuizione è seducente: se un po’ di contesto recuperato aiuta, di più deve aiutare di più. Recupera cinquanta documenti invece di cinque. Un ampio studio di benchmark ha scoperto che l’intuizione crolla.
TL;DR
- Aggiungere più contesto recuperato aiuta — fino a un certo punto, poi si assesta su un plateau.
- Per molti modelli, l’accuratezza in realtà diminuisce quando il contesto diventa molto lungo.
- Solo i modelli più potenti reggono a contesti molto lunghi; la maggior parte si degrada prima.
La tentazione del «basta recuperare di più»
In un sistema di recupero scegli quanto estrarre. Poiché le finestre lunghe sono economiche da riempire, perché non recuperare con generosità e lasciare che il modello selezioni? La speranza è che più passaggi recuperati significhino una maggiore probabilità che la risposta sia da qualche parte nel prompt.
Cosa dimostra la ricerca
In Long Context RAG Performance of LLMs, i ricercatori di Databricks hanno condotto esperimenti di recupero su 20 modelli open-source e commerciali — che spaziano tra le principali famiglie — su tre dataset specifici di dominio. Per ciascuno hanno tenuto fisso il retriever e fatto crescere in modo costante la quantità di contesto recuperato fornita al modello, da 2.000 fino a 128.000 token (e fino a due milioni dove il modello lo consentiva), misurando la correttezza della risposta a ogni passo.
Lo schema era coerente: l’accuratezza migliora man mano che aggiungi contesto all’inizio, poi si satura, e per molti modelli diminuisce mentre il contesto continua a crescere. Fatto cruciale, solo una manciata dei modelli più recenti e all’avanguardia ha mantenuto l’accuratezza stabile oltre circa 64.000 token; la maggior parte raggiungeva il picco prima e poi calava. Più token nella finestra non si traducevano in più risposte corrette.
Riempire la finestra è facile. Far sì che il modello usi tutto ciò che vi è contenuto è la parte difficile — e oltre un certo punto, aggiungerne di più gioca contro di te.
Questo si allinea a due cose che abbiamo già visto: i modelli leggono poco il centro di un contesto lungo, e il contesto lungo scambia costo per qualità. Accumulare testo recuperato spinge una parte maggiore del segnale rilevante in quel centro poco letto e fa pagare ogni token in più.
Cosa significa per te
La regola pratica è precisione più che volume. Pochi passaggi altamente rilevanti e ben collocati battono un enorme scarico di testo vagamente correlato — e costano meno. Se la qualità delle risposte del tuo sistema si assesta su un plateau, la soluzione è di solito una selezione migliore, non più contesto recuperato.
Dove si colloca FocusLM
FocusLM è costruito attorno alla precisione. Poiché il tuo materiale è archiviato come una memoria strutturata anziché come un mucchio piatto, il sistema può far emergere i pochi passaggi che riguardano davvero la tua domanda — con citazioni — invece di inondare il modello di tutto e sperare. È la stessa lezione che insegna il benchmark, incorporata nel prodotto: il contesto giusto, non il massimo contesto.