M05 · Anatomia della chatbot, token e LLM¶
Se pensate che la chat stia leggendo quello che avete scritto, vi sbagliate di grosso. Sta leggendo una sequenza di numeri.
Perché¶
Tra quando premi invio e quando compare la risposta succedono cose che spiegano quasi tutti i comportamenti strani delle chatbot: perché sbaglia i conti, perché l'italiano costa più dell'inglese, perché la risposta esce "una parola alla volta", perché non fa copia-incolla.
Obiettivi¶
- Disegnare il percorso prompt → tokenizzatore → token ID → LLM → token ID → detokenizzatore → risposta.
- Vedere con i propri occhi come un testo viene spezzato in token.
- Capire che un LLM è un predittore del token successivo e che genera sul momento, senza copiare.
- Trarre conseguenze pratiche: lingua, costi, calcoli.
Concetti chiave¶
| Concetto | Come lo dico | Stabilità |
|---|---|---|
| Chatbot | Chat + bot (da robot, dal ceco robota, lavoro servile; Čapek, R.U.R., 1920). Uno "schiavo delle chiacchiere" | stabile |
| Prompt | Un'istruzione in linguaggio naturale. "Linguaggio naturale" è un termine tecnico | stabile |
| Token | Sequenza di caratteri a cui è associato un numero. Come i mattoncini Lego: non si mescolano, si combinano | stabile |
| Tokenizzatore | Ogni famiglia di modelli ha il suo. Lo spezzettamento lo decide un'ottimizzazione matematica, non un linguista | stabile |
| LLM | Large language model: il modello allenato che gestisce il linguaggio. Il motore | stabile |
| Predittore del token successivo | Produce un token alla volta, rileggendo ogni volta quello che ha già scritto | evolutivo |
| Niente copia-incolla | La risposta è generata sul momento. Per questo costa energia, come lo streaming rispetto alla parabola | stabile |
| Numeri come testo | I numeri vengono trattati come testo, non come quantità. Per i calcoli servono strumenti (code interpreter) | evolutivo |
| Lingua e costi | L'inglese usa meno token dell'italiano: meno calcoli, meno costo. L'italiano funziona comunque bene | volatile |
Come lo conduco¶
- Etimologia (5 min). Chat, bot, robot, Čapek. I robot originali di R.U.R. erano biologici, non meccanici.
- Lo schema (10 min). Lo disegniamo insieme sul quaderno. Schema: schema: anatomia-chatbot.
- Laboratorio sul tokenizzatore (25 min). Scheda: tokenizzatore.
- Implicazioni (10 min). Inglese vs italiano; si paga a token (negli agenti non esistono tariffe flat); i numeri sono testo; un minimo di gentilezza nel prompt aiuta, perché scrivi meglio tu, non perché il modello è più disponibile.
- Il gioco della frase a catena (15 min). Scheda: frase a catena.
- Niente copia-incolla (10 min). "Chi vi dice che la chatbot fa copia-incolla, bocciatelo." Il caso dei libri protetti da copyright che a volte il modello "rigurgita": memorizzazione, non ricerca.
- Dati e privacy (10 min). Dove va il prompt quando premo invio? Account gratuiti, a pagamento, aziendali. Rimando a M11.
Frasi che uso¶
- "Il prompt per l'umano è una sequenza di parole. Per la macchina, una sequenza di numeri."
- "Non è design: il testo esce piano piano perché viene generato piano piano."
- "Non c'è un linguista, non c'è Chomsky. C'è un problema di ottimizzazione."
Punti critici e da verificare¶
- Valori del tokenizzatore (ID dei token, conteggi come "53 token in inglese, 81 in italiano"): dipendono dal modello e dalla versione dello strumento. Riverificare prima di ogni corso.
- "100 token ≈ 75 parole": regola indicativa per l'inglese comune, dichiarata da OpenAI. Non vale per l'italiano.
- Transformer: introdotto da ricercatori Google nel 2017 (Attention Is All You Need), sperimentato sulla traduzione automatica ma pensato come architettura generale.
- Hardware locale e prezzi: le indicazioni su RAM e costi dei computer per i modelli locali sono volatili. Vedi M08.
Collegamenti¶
- Prima: M04 · Complessità · Dopo: M06 · Caratteristiche dell'LLM