Scegliere il modello per il compito, non dalla classifica
Le classifiche misurano capacità generali su prove standardizzate. Trenta casi reali presi dal vostro flusso di lavoro dicono in mezza giornata quello che nessun benchmark può dire.
In sintesi. Le classifiche pubbliche misurano capacità generali su prove standardizzate, mentre un'azienda deve sapere se un modello risolve un compito specifico sui propri documenti, nella propria lingua e dentro i propri vincoli di costo e latenza. La differenza tra i due criteri è il motivo per cui molte scelte di modello vengono rifatte dopo pochi mesi, con il costo di integrazione pagato due volte.
La domanda che arriva più spesso riguarda quale modello sia il migliore. È la domanda sbagliata, e la risposta utile parte da un'altra direzione: quale compito deve svolgere, con quale margine di errore accettabile, e chi se ne accorge quando sbaglia.
Costruire un set di valutazione interno
Serve meno lavoro di quanto sembri. Si raccolgono tra trenta e cinquanta casi reali, presi dal flusso di lavoro che si vuole assistere, ciascuno con la risposta che un professionista esperto considererebbe corretta, incluse le risposte scomode dove la risposta giusta è che l'informazione non c'è.
Quel set va usato su tutti i modelli candidati, con la stessa istruzione e senza sapere quale modello ha prodotto quale risposta durante la valutazione. In mezza giornata di lavoro si ottiene un'informazione che nessuna classifica può dare, perché è costruita sui vostri documenti e sui vostri casi limite.
Il set resta utile dopo la scelta, perché diventa il riferimento per verificare un aggiornamento del fornitore o un cambio di versione, che possono spostare il comportamento senza preavviso.
I criteri che pesano davvero
| Criterio | Perché conta nella pratica |
|---|---|
| Accuratezza sul compito specifico | È l'unica misura che riguarda il vostro lavoro |
| Comportamento quando l'informazione manca | Un modello che inventa costa più di uno meno brillante che si ferma |
| Latenza | Dentro un processo con operatore a video, due secondi cambiano l'adozione |
| Costo per volume reale | Il prezzo unitario dice poco finché non si moltiplica per i volumi veri |
| Residenza dei dati e condizioni d'uso | Determina se il caso d'uso è praticabile, prima ancora che conveniente |
| Documentazione del fornitore | Serve a voi per la vostra documentazione, e va chiesta prima |
| Politica di deprecazione delle versioni | Stabilisce quanto preavviso avrete quando il modello che usate verrà ritirato |
L'ultima riga è quella che le aziende scoprono tardi. Un modello ritirato con tre mesi di preavviso obbliga a rifare la validazione del caso d'uso, e se la validazione non era documentata si riparte da zero.
Quale framework serve davvero alla tua azienda?
L'AI Rating misura la maturità sulle quattro aree del modello e indica da dove partire, con priorità e sforzo stimato.
Avvia il tuo AI RatingIl modello è un componente, non il progetto
Nei progetti che vanno in produzione il modello pesa meno di quanto si creda sul risultato finale. Pesano di più la qualità dei dati che gli vengono dati in pasto, la precisione delle istruzioni, i controlli a valle e il modo in cui l'output entra nel processo.
Questo ha una conseguenza pratica sulla scelta: conviene decidere in fretta, con un set di valutazione onesto, e investire il tempo risparmiato sull'integrazione. Un modello discreto dentro un processo ben costruito batte un modello eccellente appoggiato a un flusso improvvisato.
La documentazione da conservare
Chi usa un modello di uso generale dentro un proprio sistema resta responsabile del sistema. Il fornitore del modello ha obblighi propri e deve mettere a disposizione documentazione tecnica e informazioni sulle capacità e sui limiti, e quel materiale serve a costruire la documentazione del sistema.
Vanno quindi conservati la versione del modello usata, i risultati della valutazione interna, le istruzioni di sistema in uso e la data in cui sono cambiate. È il materiale che permette di spiegare una decisione a distanza di un anno, quando nessuno ricorda perché si era scelto in quel modo.
Da dove partire
I criteri generali tra modelli proprietari e aperti sono in LLM proprietari e open source, mentre il tema dei benchmark è in benchmark e valutazione dei modelli.
La scelta di dove eseguire è trattata in on premise, cloud o API, e il rischio di dipendenza in lock-in tecnologico.
Per impostare una valutazione sui vostri casi reali puoi fissare un incontro.