M08 · Scegliere il modello, ragionamento e valutazioni¶
Non esiste lo strumento migliore in assoluto. Mettetevelo in testa.
Perché¶
"Qual è la chatbot migliore?" è la domanda che mi fanno di più. La risposta onesta è: dipende dal compito, dal budget, dai vincoli sui dati e da come ti trovi tu. Il modulo dà gli strumenti per rispondersi da soli.
Obiettivi¶
- Distinguere modelli grandi e piccoli, veloci e lenti, con e senza ragionamento.
- Capire cosa fa un modello "che ragiona" (e cosa non fa).
- Usare classifiche di due tipi: preferenze degli utenti (arena) e test strutturati (benchmark).
- Distinguere open source e open weights, e valutare quando ha senso un modello locale.
Concetti chiave¶
| Concetto | Come lo dico | Stabilità |
|---|---|---|
| Parametri | I numeri che il modello ha imparato. Come i coefficienti a, b, c in un'equazione ax + by + c | stabile |
| Grande vs piccolo | Più parametri, più capacità (se l'apprendimento è fatto bene), più tempo e costo. Per tradurre tre frasi non serve il modello più grande | stabile |
| Ragionamento | Prima di rispondere il modello genera token di "pensiero interno": riepiloga la richiesta, prova a confutarsi, converge | evolutivo |
| Chain of thought | Aggiungere "pensiamo passo per passo" migliorava molto le risposte. Oggi è incorporato nei modelli | stabile |
| Modalità automatica | Alcune app scelgono il modello in base al prompt, anche uno più economico | volatile |
| Arena | Classifica costruita dai voti degli utenti, alla cieca | evolutivo |
| Benchmark | Test strutturati, uguali per tutti i modelli (come il quiz della patente) | evolutivo |
| Open weights | Puoi scaricare i pesi e usare il modello sul tuo computer. Open source vorrebbe dire anche dati e ricetta: come il pizzaiolo che ti dà gli ingredienti e ti fa vedere come fa la pizza | stabile |
| Modello locale | Funziona senza internet, i dati non escono. È lento e richiede molta memoria | evolutivo |
Come lo conduco¶
- Il selettore dei modelli (10 min). Pro, Flash, Lite: cosa vuol dire. L'analogia dei motori (1.000 cc tre cilindri o 3.000 turbo).
- Ragionare o no (25 min). Scheda: l'autolavaggio e il carrello. Uso chat che mostrano il ragionamento in chiaro: leggerlo toglie la magia.
- Regole pratiche (10 min). Compiti semplici: modello veloce. Problemi complessi e codice: modello che ragiona. Con un modello che ragiona descrivi bene il problema e il contesto, ma non dettare i passaggi; con un modello veloce puoi indicarli.
- Le classifiche (25 min). Arena in modalità "battaglia" (vota alla cieca), poi la classifica per caso d'uso (una lingua, la scrittura creativa). Poi un sito di benchmark strutturati: intelligenza, velocità, prezzo per milione di token, verbosità, finestra di contesto. Se il grafico è difficile, uno screenshot e lo si fa spiegare a una chat.
- Open weights e locale (15 min). Demo di una chat locale lenta e "scarsa", per sentire la differenza. Quando ha senso: dati che non possono uscire, anonimato. Costi reali di un server aziendale (con l'analogia del camion di proprietà e del padroncino).
- La regola d'oro (5 min). Un piccolo budget di prova (es. un mese su due servizi diversi), uso quotidiano, poi si sceglie. "Non è una fede."
Frasi che uso¶
- "Ogni modello ha la sua personalità. Cambiare modello è come cambiare collega."
- "Fidarsi non è mai la scelta giusta. Bisogna informarsi, e i dati online ci sono tutti."
- "Validazione incrociata: il risultato di un modello lo faccio criticare da un altro. Prende più tempo, non meno."
Punti critici e da verificare¶
- Numero di parametri dei modelli commerciali: per i modelli chiusi le aziende non pubblicano questi numeri. Le cifre che circolano sono stime: vanno sempre presentate come tali, con la fonte.
- Prezzi per token: volatili, da datare sempre.
- Vincoli normativi (dati, minori, conservazione dei dati): quali fornitori si possono usare in un contesto dipende da contratti, termini d'uso e versioni dei servizi. Va verificato caso per caso, non generalizzato.
- "Con buone tecniche di prompt un modello che ragiona sbaglia pochissimo": affermazione troppo forte. Riformulare: "sbaglia molto meno, ma sbaglia".
Collegamenti¶
- Prima: M07 · Dopo: M09 · Prompting