L'obiettivo è spiegare, con un livello tecnico accessibile, che cosa accade realmente quando un LLM riceve una domanda e genera una risposta.
Si parte dall'idea fondamentale, la previsione del token successivo, per arrivare gradualmente ai principali concetti che rendono possibile il funzionamento di questi modelli:
- token ed embedding;
- transformer e meccanismo di attention;
- generazione autoregressiva;
- funzione di perdita, backpropagation ed addestramento;
- post-training ed apprendimento dalle preferenze;
- contesto, memoria e strumenti esterni;
- allucinazioni e limiti dei modelli;
- struttura di base di una rete neurale;
- vettori, matrici, connessioni residue e reti feed-forward.
Abbiamo cercato soprattutto di evitare due estremi: descrivere un LLM come una sorta di archivio intelligente di risposte oppure, al contrario, liquidarlo semplicemente come un "autocompletamento molto sofisticato".
Tecnicamente un LLM genera il testo prevedendo iterativamente il token successivo. Ma per riuscire a farlo bene costruisce rappresentazioni interne capaci di catturare linguaggio, relazioni tra concetti, conoscenze e schemi utili anche per attività di ragionamento, programmazione e analisi.
La guida contiene inoltre alcuni brevi approfondimenti matematici per chi vuole capire meglio cosa avviene sotto la superficie, senza richiedere conoscenze specialistiche di machine learning.
Il documento è disponibile liberamente su GitHub ed è distribuito con licenza CC BY-SA 4.0.
https://github.com/morinim/documents/tree/master/panoramica_llm
