Dentro il tokenizzatore¶
In una frase: guardare come una frase diventa pezzi e numeri, e scoprire che la macchina non legge parole.
Passaggi¶
- Aprire la demo del tokenizzatore e caricare il testo di esempio. Contare token e caratteri. Attivare la vista degli ID: ecco cosa "legge" il modello.
- Scrivere "money money money money" (o qualsiasi parola ripetuta). Gli ID non sono tutti uguali: lo spazio fa parte del token.
- Una parola lunga: viene spezzata senza nessuna logica linguistica.
- Scrivere una frase in italiano, poi incollarne la traduzione inglese: l'italiano usa più token.
- Scrivere un numero lungo: viene spezzato come testo, non per unità, decine e centinaia.
Debriefing¶
- Chi ha deciso come spezzare le parole? Nessun linguista: un'ottimizzazione matematica, diversa per ogni famiglia di modelli.
- Più token vuol dire più calcoli, più tempo, più costo, più energia. Perché chi sviluppa agenti scrive i prompt in inglese?
- Perché le chatbot sbagliano i calcoli?
Cosa può andare storto¶
La demo a volte ha dei bug, e gli ID cambiano con le versioni dei modelli. Provarla sempre la sera prima.