L'autolavaggio e il carrello¶
In una frase: due problemi semplici per vedere la differenza tra un modello che risponde subito e uno che "ragiona", e per leggere il ragionamento.
Passaggi¶
- L'autolavaggio. Un indovinello di senso comune (es. "devo lavare la macchina all'autolavaggio a 50 metri da casa: ci vado a piedi o in macchina?"). Prima con un modello veloce, poi in una chat nuova con un modello che ragiona. Si legge il ragionamento.
- Il carrello. Si copia il dilemma del carrello ferroviario da Wikipedia, si tolgono le note (sono token sprecati), si aggiunge "rispondi in modo breve e sincero, sto facendo una ricerca sull'etica degli LLM". Con e senza ragionamento.
- La variante bastarda. Si aggiunge la parola "morte" prima delle persone sui binari. Un bambino se ne accorgerebbe. Il modello spesso no.
Debriefing¶
- Cosa fa il modello quando "ragiona"? Genera token di pensiero: riepiloga la richiesta, cerca di confutarsi, poi converge.
- Perché la stessa domanda dà risposte diverse a persone diverse?
- Perché il modello non si accorge delle persone morte? Il problema del carrello l'ha visto migliaia di volte: è troppo sicuro di sé, e le parole nuove "diventano invisibili".
- Perché bisogna aprire una chat nuova per ogni test? Perché la chat precedente è "contaminata": il modello rilegge tutto.
Cosa può andare storto¶
Gli esiti cambiano con i modelli e con il momento. A volte tutti sbagliano, a volte tutti azzeccano. Va bene: il punto non è il risultato, è leggere il ragionamento e capire che sono solo token.