Vai al contenuto

M08 · Scegliere il modello, ragionamento e valutazioni

Non esiste lo strumento migliore in assoluto. Mettetevelo in testa.

Perché

"Qual è la chatbot migliore?" è la domanda che mi fanno di più. La risposta onesta è: dipende dal compito, dal budget, dai vincoli sui dati e da come ti trovi tu. Il modulo dà gli strumenti per rispondersi da soli.

Obiettivi

  • Distinguere modelli grandi e piccoli, veloci e lenti, con e senza ragionamento.
  • Capire cosa fa un modello "che ragiona" (e cosa non fa).
  • Usare classifiche di due tipi: preferenze degli utenti (arena) e test strutturati (benchmark).
  • Distinguere open source e open weights, e valutare quando ha senso un modello locale.

Concetti chiave

Concetto Come lo dico Stabilità
Parametri I numeri che il modello ha imparato. Come i coefficienti a, b, c in un'equazione ax + by + c stabile
Grande vs piccolo Più parametri, più capacità (se l'apprendimento è fatto bene), più tempo e costo. Per tradurre tre frasi non serve il modello più grande stabile
Ragionamento Prima di rispondere il modello genera token di "pensiero interno": riepiloga la richiesta, prova a confutarsi, converge evolutivo
Chain of thought Aggiungere "pensiamo passo per passo" migliorava molto le risposte. Oggi è incorporato nei modelli stabile
Modalità automatica Alcune app scelgono il modello in base al prompt, anche uno più economico volatile
Arena Classifica costruita dai voti degli utenti, alla cieca evolutivo
Benchmark Test strutturati, uguali per tutti i modelli (come il quiz della patente) evolutivo
Open weights Puoi scaricare i pesi e usare il modello sul tuo computer. Open source vorrebbe dire anche dati e ricetta: come il pizzaiolo che ti dà gli ingredienti e ti fa vedere come fa la pizza stabile
Modello locale Funziona senza internet, i dati non escono. È lento e richiede molta memoria evolutivo

Come lo conduco

  1. Il selettore dei modelli (10 min). Pro, Flash, Lite: cosa vuol dire. L'analogia dei motori (1.000 cc tre cilindri o 3.000 turbo).
  2. Ragionare o no (25 min). Scheda: l'autolavaggio e il carrello. Uso chat che mostrano il ragionamento in chiaro: leggerlo toglie la magia.
  3. Regole pratiche (10 min). Compiti semplici: modello veloce. Problemi complessi e codice: modello che ragiona. Con un modello che ragiona descrivi bene il problema e il contesto, ma non dettare i passaggi; con un modello veloce puoi indicarli.
  4. Le classifiche (25 min). Arena in modalità "battaglia" (vota alla cieca), poi la classifica per caso d'uso (una lingua, la scrittura creativa). Poi un sito di benchmark strutturati: intelligenza, velocità, prezzo per milione di token, verbosità, finestra di contesto. Se il grafico è difficile, uno screenshot e lo si fa spiegare a una chat.
  5. Open weights e locale (15 min). Demo di una chat locale lenta e "scarsa", per sentire la differenza. Quando ha senso: dati che non possono uscire, anonimato. Costi reali di un server aziendale (con l'analogia del camion di proprietà e del padroncino).
  6. La regola d'oro (5 min). Un piccolo budget di prova (es. un mese su due servizi diversi), uso quotidiano, poi si sceglie. "Non è una fede."

Frasi che uso

  • "Ogni modello ha la sua personalità. Cambiare modello è come cambiare collega."
  • "Fidarsi non è mai la scelta giusta. Bisogna informarsi, e i dati online ci sono tutti."
  • "Validazione incrociata: il risultato di un modello lo faccio criticare da un altro. Prende più tempo, non meno."

Punti critici e da verificare

  • Numero di parametri dei modelli commerciali: per i modelli chiusi le aziende non pubblicano questi numeri. Le cifre che circolano sono stime: vanno sempre presentate come tali, con la fonte.
  • Prezzi per token: volatili, da datare sempre.
  • Vincoli normativi (dati, minori, conservazione dei dati): quali fornitori si possono usare in un contesto dipende da contratti, termini d'uso e versioni dei servizi. Va verificato caso per caso, non generalizzato.
  • "Con buone tecniche di prompt un modello che ragiona sbaglia pochissimo": affermazione troppo forte. Riformulare: "sbaglia molto meno, ma sbaglia".

Collegamenti