Intelligenza artificiale

Jev e la macchina dell'hype: quando un classificatore diventa «il nuovo momento ChatGPT»

Jev e la macchina dell'hype: quando un classificatore diventa «il nuovo momento ChatGPT»

C'è qualcosa di affascinante nel modo in cui funziona l'informazione sull'intelligenza artificiale. Un prodotto viene annunciato, qualcuno pubblica una demo sorprendente, parte un thread su X, arrivano i primi benchmark, qualcuno pronuncia la parola "rivoluzione" e nel giro di quarantotto ore una tecnologia che fino al giorno prima non esisteva nel dibattito pubblico diventa improvvisamente qualcosa che "cambia tutto".

È più o meno quello che è successo con Jev, il nuovo modello di TypeSafe AI.

Jev è interessante. È velocissimo, costa pochissimo e affronta in modo molto diretto un problema reale: moltissimi software usano oggi enormi language model per compiti che, alla fine, consistono semplicemente nel prendere una decisione.

Questa email è spam? Questo ticket va all'assistenza tecnica o commerciale? Questa azione di un agente è rischiosa? Quale strumento dovrebbe utilizzare il software?

Per domande del genere Jev non genera una risposta parola dopo parola. Riceve uno stato, alcune possibili decisioni e restituisce valori strutturati e probabilità. È pensato quindi per classificare, valutare, instradare e decidere rapidamente all'interno del software.

Fin qui tutto bene.

Il problema comincia quando da "strumento specializzato potenzialmente molto utile" si passa a "nuovo paradigma dell'intelligenza artificiale".

Ed è esattamente quello che è successo.

In meno di 48 ore Jev era già diventato un nuovo "momento ChatGPT"

Uno degli esempi più evidenti viene dalla newsletter ThursdAI di Alex Volkov.

Il titolo dell'edizione dedicata al modello presenta Jev come un "ChatGPT moment for decisions". Nell'articolo Volkov racconta di averlo utilizzato per circa mezza giornata e scrive che è già chiaro che ci troviamo davanti a un "new paradigm of AI". Poco dopo compare un intero paragrafo intitolato "This is about to change everything".

Il livello di entusiasmo diventa ancora più evidente quando compare l'affermazione secondo cui "speed IS intelligence" e quando l'autore prevede che anche chi inizialmente non crede all'hype finirà presto per ricredersi.

È una narrazione potentissima.

È anche una conclusione sorprendentemente grande da raggiungere dopo poche ore di utilizzo di un modello appena pubblicato.

Perché Jev non ha dimostrato di essere un nuovo ChatGPT. Non ha dimostrato una nuova capacità generale dell'intelligenza artificiale. Non è neppure progettato per ragionare, conversare o generare testo.

È stato progettato precisamente per rinunciare a gran parte di queste possibilità in cambio di velocità, costo ridotto e output strutturati.

La distinzione è fondamentale.

Un nuovo database estremamente veloce può cambiare il modo in cui costruiamo certe applicazioni senza per questo rappresentare "un nuovo momento Internet". Allo stesso modo, un ottimo componente per il decision-making automatico può diventare importantissimo nell'infrastruttura AI senza costituire necessariamente un salto fondamentale nell'intelligenza dei modelli.

Passare dall'una all'altra affermazione richiede molte più prove di quelle disponibili dopo mezza giornata.

TechCrunch e quel problematico "non può avere allucinazioni"

Il 18 settembre TechCrunch ha pubblicato un articolo intitolato "A new kind of AI model from a ChatGPT inventor is thrilling developers".

L'articolo è interessante e contiene anche osservazioni utili, ma adotta una formulazione che mostra bene quanto facilmente la comunicazione intorno a Jev possa diventare fuorviante.

Descrivendo i vantaggi del modello, TechCrunch scrive che, dato che gli output vengono definiti in anticipo dagli utenti, Jev "cannot hallucinate".

Qui bisogna fermarsi.

Jev può certamente sbagliare.

Quello che non può fare è produrre un output fuori dal tipo previsto.

Supponiamo di obbligare un modello a rispondere esclusivamente con:

spam commerciale personale

Jev non potrà inventarsi una quarta categoria chiamata fattura_urgente. Questa è una proprietà molto utile.

Ma potrà perfettamente classificare come commerciale un'email che in realtà è spam.

Le due cose sono molto diverse.

Ed è la stessa TypeSafe a fornire il caveat decisivo. Parlando del proprio grafico sulle hallucination, l'azienda precisa esplicitamente che il suo valore dello 0% "is not empirical": deriva dal fatto che la corrispondenza con lo schema è garantita.

In altre parole, quello 0% non misura quanto spesso Jev fornisca una decisione corretta. Misura quanto spesso restituisca una decisione formalmente valida.

Sempre.

È un vantaggio ingegneristico concreto. Ma trasformarlo semanticamente in "non ha allucinazioni" crea nel lettore un'impressione molto più forte: sembra significare che il modello non inventi o non sbagli.

Non è ciò che quel numero dimostra.

I numeri spettacolari: 194 volte più veloce, 445 volte più economico

Poi ci sono i benchmark.

Le cifre che hanno alimentato gran parte della viralità di Jev sono straordinarie: TypeSafe parla di guadagni fino a circa 193,6 volte sulla velocità e 444,6 volte sul costo rispetto agli LLM nelle proprie workflow evaluations.

Numeri così finiscono inevitabilmente nei titoli.

Ma c'è un dettaglio particolarmente interessante: la stessa TypeSafe è più prudente di molti commentatori che citano TypeSafe.

Nel suo articolo di lancio, l'azienda precisa infatti che quei valori probabilmente si trovano nella fascia alta dei miglioramenti ottenibili nel mondo reale. Ammette inoltre che i workflow sono stati costruiti da membri del proprio model-capabilities team e che quindi "some bias could exist".

Ancora più significativo è il metodo utilizzato per determinare la qualità delle risposte.

Non c'è sempre una ground truth verificata da esseri umani. TypeSafe confronta le decisioni dei modelli con una risposta di riferimento ottenuta mediando le predizioni di due grandi modelli, GPT-6 Astra e Fable 5.1.

Quindi quello che viene facilmente chiamato "accuracy" è, più precisamente, accordo con una reference costruita usando altri modelli.

È una metodologia possibile. Non è però la stessa cosa di dimostrare che una risposta sia oggettivamente corretta.

DataCamp, in un'analisi decisamente più prudente, riporta i risultati del benchmark TypeSafe: Jev raggiunge il 67,8%, praticamente alla pari con GPT-5.6 Terra al 67,9%, mentre GPT-5.6 Sol arriva al 74,1% e Claude Opus 5 al 73,1%.

La conclusione interessante non è quindi:

"Jev è intelligente quanto i migliori modelli ma 445 volte più economico."

È qualcosa di molto più circoscritto e, paradossalmente, già abbastanza impressionante:

su certi workflow decisionali costruiti per questo genere di utilizzo, Jev ottiene prestazioni vicine a modelli molto più costosi spendendo enormemente meno e rispondendo enormemente più velocemente.

Non serve gonfiare l'affermazione. È già un risultato interessante.

Anche TypeSafe riconosce che alcune demo favoriscono Jev

C'è un altro particolare che quasi scompare quando il messaggio viene rilanciato sui social.

Parlando della propria demo comparativa, TypeSafe spiega che l'input è volutamente breve, denso e dettagliato, e riconosce esplicitamente che questa caratteristica mette Jev in una posizione vantaggiosa.

Questa è buona trasparenza da parte dell'azienda.

Ma crea un curioso cortocircuito comunicativo.

Il produttore dice:

questa demo enfatizza intenzionalmente il vantaggio della nostra metodologia; i guadagni massimi dei benchmark probabilmente rappresentano la fascia alta; qualche bias nei workflow potrebbe esserci.

Internet traduce:

200x più veloce. 400x più economico. Nuovo paradigma. Cambierà tutto.

Il fenomeno interessante non è quindi soltanto il marketing dell'azienda. È ciò che succede al marketing quando attraversa diversi livelli di amplificazione.

Ad ogni passaggio tendono a scomparire le condizioni.

Rimane il moltiplicatore.

"È il futuro dell'AI?"

Un caso ancora più interessante è Top5Apps, che già nel titolo del giorno del lancio si domanda: "Is a Model That Doesn't Talk the Future of AI?"

L'articolo è in realtà molto più equilibrato del titolo. Ricorda che classificatori, reward model e modelli specializzati esistono da tempo, e sottolinea che la promessa fondamentale di Jev, in particolare la qualità della sua calibrazione, al momento del lancio era ancora principalmente un'affermazione del produttore, senza paper tecnico e senza una vasta validazione indipendente.

Eppure arriva comunque a una conclusione enorme: definisce Jev la "strongest evidence yet" che una gigantesca quota del futuro lavoro dell'AI sarà fatta da decisioni anziché conversazioni.

Può succedere.

Ma qui entriamo nel territorio della previsione, non dell'evidenza sperimentale.

Che migliaia di operazioni oggi affidate agli LLM siano in realtà semplici problemi di classificazione, scoring e routing è un'osservazione ragionevole. Che Jev abbia trovato un modo economicamente efficace di affrontarli è plausibile.

Che da questo si possa già dedurre l'architettura dominante dei futuri sistemi AI è molto più difficile da sostenere.

Tra l'altro non conosciamo neppure nel dettaglio l'architettura interna del modello. TechCrunch riferisce che TypeSafe non ne ha divulgato molti particolari e che alcuni osservatori sospettano possa essere costruito partendo da un modello open-weight.

Presentare oggi "System One" come una nuova categoria tecnologica consolidata rischia quindi di confondere il nome scelto da un'azienda per descrivere il proprio approccio con una nuova classe scientifica già chiaramente caratterizzata.

Poi arriva Vercel: il modello adottato più rapidamente di sempre

Il fenomeno dell'hype ha però una componente reale che non dovrebbe essere ignorata.

Vercel ha comunicato che Jev è stato il modello adottato più rapidamente nella storia del suo AI Gateway. Nelle prime 24 ore sarebbe stato utilizzato da quasi il 13% dei team paganti, più del doppio rispetto alla famiglia GPT-5.6 nello stesso periodo di lancio.

Questo è un dato interessante.

Dimostra una cosa: Jev ha suscitato un'enorme curiosità tra gli sviluppatori.

Ma non dimostra automaticamente che Jev rappresenti un grande progresso scientifico.

L'adozione immediata misura anche novità, viralità, prezzo, curiosità e facilità con cui una tecnologia può essere sperimentata. Non necessariamente la sua importanza a lungo termine.

Vercel stessa inserisce infatti il caveat corretto: il vero test sarà vedere se questa adozione iniziale continuerà.

È una frase molto meno spettacolare del titolo, ma scientificamente molto più interessante.

Il paradosso dell'hype su Jev

La cosa più divertente è che Jev potrebbe davvero diventare un ottimo prodotto.

Potrebbe persino diventare un componente estremamente diffuso nelle architetture agentiche.

Se per classificare dieci milioni di eventi non ho bisogno di un modello che scriva, ragioni a lungo e generi centinaia di token, utilizzare qualcosa di specializzato, economico e veloce è perfettamente sensato.

La possibilità di ottenere probabilità sufficientemente ben calibrate è inoltre preziosa. Permette, per esempio, di costruire pipeline nelle quali un caso viene elaborato automaticamente sopra una determinata soglia di confidenza e inviato invece a un modello più potente o a un essere umano quando l'incertezza aumenta.

Questo è un buon use case.

Ma un buon use case non equivale automaticamente a una rivoluzione tecnologica.

Ed è proprio qui che Jev diventa interessante come fenomeno culturale oltre che tecnico.

Nel giro di pochi giorni siamo passati da un modello specializzato appena lanciato, con architettura non pubblicata nei dettagli e benchmark ancora prevalentemente prodotti dall'azienda, a espressioni come:

"ChatGPT moment".

"New paradigm".

"Changes everything".

"Future of AI".

La quantità di attenzione diventa quindi essa stessa una prova della presunta importanza della tecnologia.

Tutti ne parlano perché tutti ne parlano.

La domanda giusta non è se Jev sia rivoluzionario

Forse tra due anni scopriremo che TypeSafe aveva individuato prima degli altri un livello fondamentale dello stack dell'intelligenza artificiale.

Oppure scopriremo che la stessa idea viene rapidamente replicata usando modelli più piccoli, classifier tradizionali, modelli fine-tuned o nuove funzioni integrate direttamente nei grandi LLM.

È troppo presto per saperlo.

Ed è precisamente questo il punto.

La domanda interessante oggi non è:

"Jev cambierà tutto?"

È:

"Per quali problemi Jev offre un vantaggio misurabile rispetto alle alternative?"

Quanti task possono essere risolti con la stessa accuratezza?

Quanto rimane della differenza di costo quando aggiungiamo fallback verso LLM più potenti?

Quanto sono calibrate le probabilità fuori dai dataset e dai workflow utilizzati durante lo sviluppo?

Come si comporta in distribuzioni differenti?

Quanto delle prestazioni dipende dalla decomposizione del problema effettuata dal programmatore?

Un piccolo modello fine-tuned su dati specifici può fare meglio?

E soprattutto: quali dei risultati pubblicati finora verranno riprodotti da benchmark realmente indipendenti?

Queste sono domande meno virali.

Ma sono quelle che permettono di distinguere una tecnologia importante da una tecnologia semplicemente molto discussa.

Jev non deve essere inutile perché l'hype sia eccessivo.

Anzi, probabilmente il fenomeno è più interessante proprio per questo: potremmo avere davanti un prodotto molto intelligente dal punto di vista industriale e, contemporaneamente, una narrazione completamente sproporzionata sul piano tecnologico.

L'una cosa non esclude l'altra.

E forse la lezione più importante di Jev non riguarda affatto Jev.

Riguarda la velocità con cui oggi, nell'intelligenza artificiale, trasformiamo un benchmark in una tendenza, una tendenza in un paradigma e un paradigma in una rivoluzione, spesso prima ancora di avere avuto il tempo di capire esattamente che cosa abbiamo davanti.

Scritto da Claudio