Vai al contenuto

Dentro il tokenizzatore

In una frase: guardare come una frase diventa pezzi e numeri, e scoprire che la macchina non legge parole.

Passaggi

  1. Aprire la demo del tokenizzatore e caricare il testo di esempio. Contare token e caratteri. Attivare la vista degli ID: ecco cosa "legge" il modello.
  2. Scrivere "money money money money" (o qualsiasi parola ripetuta). Gli ID non sono tutti uguali: lo spazio fa parte del token.
  3. Una parola lunga: viene spezzata senza nessuna logica linguistica.
  4. Scrivere una frase in italiano, poi incollarne la traduzione inglese: l'italiano usa più token.
  5. Scrivere un numero lungo: viene spezzato come testo, non per unità, decine e centinaia.

Debriefing

  • Chi ha deciso come spezzare le parole? Nessun linguista: un'ottimizzazione matematica, diversa per ogni famiglia di modelli.
  • Più token vuol dire più calcoli, più tempo, più costo, più energia. Perché chi sviluppa agenti scrive i prompt in inglese?
  • Perché le chatbot sbagliano i calcoli?

Cosa può andare storto

La demo a volte ha dei bug, e gli ID cambiano con le versioni dei modelli. Provarla sempre la sera prima.