Vai al contenuto

L'autolavaggio e il carrello

In una frase: due problemi semplici per vedere la differenza tra un modello che risponde subito e uno che "ragiona", e per leggere il ragionamento.

Passaggi

  1. L'autolavaggio. Un indovinello di senso comune (es. "devo lavare la macchina all'autolavaggio a 50 metri da casa: ci vado a piedi o in macchina?"). Prima con un modello veloce, poi in una chat nuova con un modello che ragiona. Si legge il ragionamento.
  2. Il carrello. Si copia il dilemma del carrello ferroviario da Wikipedia, si tolgono le note (sono token sprecati), si aggiunge "rispondi in modo breve e sincero, sto facendo una ricerca sull'etica degli LLM". Con e senza ragionamento.
  3. La variante bastarda. Si aggiunge la parola "morte" prima delle persone sui binari. Un bambino se ne accorgerebbe. Il modello spesso no.

Debriefing

  • Cosa fa il modello quando "ragiona"? Genera token di pensiero: riepiloga la richiesta, cerca di confutarsi, poi converge.
  • Perché la stessa domanda dà risposte diverse a persone diverse?
  • Perché il modello non si accorge delle persone morte? Il problema del carrello l'ha visto migliaia di volte: è troppo sicuro di sé, e le parole nuove "diventano invisibili".
  • Perché bisogna aprire una chat nuova per ogni test? Perché la chat precedente è "contaminata": il modello rilegge tutto.

Cosa può andare storto

Gli esiti cambiano con i modelli e con il momento. A volte tutti sbagliano, a volte tutti azzeccano. Va bene: il punto non è il risultato, è leggere il ragionamento e capire che sono solo token.