Perché il budget AI salta (e non è colpa dei token)
Il billing a consumo dei vendor AI sposta il rischio di spesa sui clienti. I casi Klarna, Uber e Walmart mostrano perché tagliare persone per finanziare token non sta rendendo, e dove nasce davvero il costo che nessun budget aveva previsto.
A metà luglio un report di Forrester, ripreso da The Register, ha messo per iscritto quello che in diverse aziende italiane si sospettava già: il prossimo anno le bollette del software cresceranno, e a spingerle sarà soprattutto l'AI. Anthropic, OpenAI e GitHub sono già passati al billing a consumo, Microsoft ha lanciato una licenza premium, e il messaggio implicito ai clienti enterprise è identico ovunque, l'infrastruttura che fa girare i modelli costa, e quel costo va fatto atterrare da qualche parte.
Il report però aggiunge una frase quasi di passaggio, che vale più del resto: il successo di un investimento AI dipende da quanto un'azienda ha costruito le fondamenta giuste, più che da quanto ha speso in AI in senso stretto. Le fondamenta giuste sono, in un'azienda che non ha mai misurato la propria maturità, la prima cosa che manca.
La bolletta a consumo cambia chi controlla il budget
Finché l'AI si comprava a licenza, il costo era prevedibile: un numero all'anno, negoziato una volta, rivisto al rinnovo. Il billing a consumo funziona diversamente. Cresce con l'uso, con la lunghezza dei contesti, con il numero di chiamate che un processo genera senza che nessuno le conti una per una. Un agente che gira ventiquattro ore su ventiquattro, che richiama un modello a ogni step di un flusso, che ripete una ricerca perché il primo tentativo non ha trovato la risposta giusta, produce una curva di spesa che il CFO vede solo a fattura arrivata.
Non è un problema tecnico da lasciare all'IT. È un problema di governance del consumo, che richiede soglie, alert e responsabilità chiare su chi autorizza cosa, esattamente come un'azienda tratta qualsiasi altra voce di costo variabile. Le tecniche esistono e sono documentate bene, dal caching dei prompt al dimensionamento corretto del modello per ogni task, fino al retrieval mirato che evita di ricaricare contesto inutile a ogni chiamata. Restano tecniche di ottimizzazione, non di decisione: dicono come spendere meno per un uso già scelto, non se quell'uso avesse senso fin dall'inizio.
Il baratto tra persone e token che non sta rendendo
Un secondo filone di notizie, uscite nelle stesse settimane, racconta un'altra faccia dello stesso problema. Diverse aziende, tra cui nomi noti come Klarna, Uber e Walmart, hanno spostato budget dal personale ai token, tagliando ruoli per finanziare l'adozione di AI. I primi dati che arrivano da quelle scelte, però, non mostrano il ritorno atteso: soddisfazione dei clienti in calo in alcuni casi, processi che richiedono comunque supervisione umana, risparmi sulla carta che si consumano in correzioni e rilavorazioni.
Il problema non è l'AI in sé, è la sequenza. Tagliare prima e misurare dopo inverte l'ordine che rende un investimento difendibile. Il nostro AI Rating misura la maturità su quattro dimensioni, Readiness, Delivery, Risk, Confidence, proprio perché un'azienda può avere un caso d'uso tecnicamente valido e comunque perdere soldi, se manca la capacità organizzativa di gestirlo a regime. Un modello che funziona bene in laboratorio e male in produzione racconta quasi sempre una valutazione saltata prima di scalare, più che un limite della tecnologia.
Dove il costo nasce davvero
Nei nostri assessment la domanda "quanto costa l'AI" arriva quasi sempre troppo tardi, quando il progetto è già stato deciso e il costo da giustificare è quello sostenuto, non quello evitabile. La domanda che fa risparmiare arriva prima: questo caso d'uso, con questi dati, in questa organizzazione, dove genererà valore e dove genererà solo consumo?
Un esempio ricorrente: un'azienda automatizza un processo di assistenza clienti con un agente conversazionale, misura una riduzione dei tempi di prima risposta e la presenta come successo. Sei mesi dopo, i costi operativi sono raddoppiati per via delle chiamate ripetute su casi ambigui che l'agente non sa chiudere da solo, e il personale che doveva essere liberato viene invece riassegnato a controllare le risposte prima che arrivino al cliente. Il costo non è comparso all'improvviso. Era prevedibile fin dal primo mese, se qualcuno avesse misurato il tasso di escalation prima di scalare il progetto su tutti i canali.
Cosa cambia se si misura prima
Le aziende che arrivano da noi già con una AI Rating in classe B o superiore affrontano queste conversazioni in modo diverso. Sanno quali processi hanno dati abbastanza puliti da sostenere un agente in autonomia, quali richiedono ancora supervisione, quali gate di rischio bloccano la scalabilità a prescindere da quanto il caso d'uso sembri promettente. Il costo, a quel punto, si discute per componenti separate: costo di sviluppo, costo di esercizio, costo di governance, e ciascuno viene stimato prima, non ricostruito dopo dalla fattura.
Vale anche il contrario. Un'azienda in classe D o C che investe comunque in scala rischia di pagare due volte, la prima per il progetto che non regge, la seconda per rifarlo bene una volta capito cosa non aveva funzionato. È il pattern che vediamo più spesso nei progetti che finiscono da noi dopo essere partiti altrove: non mancava il budget, mancava la sequenza.
Con i budget del 2027 in discussione nei prossimi mesi, la domanda utile non è quanto stanziare per l'AI. È se l'organizzazione sa già, con evidenze e non con impressioni, dove quel budget produrrà valore misurabile e dove produrrà solo una bolletta più alta a dicembre.