OutlinkedBy Pedro Rojo
← Tutti i post
product16 giugno 2026

Fable 5 è davvero geniale. La qualità dei software migliora a vista d'occhio.

Recensione di Claude Fable 5 per la creazione di... ogni cosa?.

Fable 5 è davvero geniale.
La qualità dei software migliora a vista d'occhio.

template: Epic Handshake

Anthropic lancia Fable 5, il suo primo modello di classe "Mythos" disponibile al pubblico, e i test sul campo rivelano capacità impressionanti ma anche limiti inaspettati. Il modello eccelle nei benchmark, superando di gran lunga Opus 4.8, GPT-5.0 e Gemini 3.1 Pro, con un punteggio dell'80% su SWBench Pro. È particolarmente forte nei compiti legati alla visione, come la creazione di fogli di lavoro manoscritti per bambini, dimostrando un'ottima formattazione e layout, superando nettamente Opus 4.8. Tuttavia, Fable 5 presenta costi elevati ($10 per milioni di token di input, $50 per milioni di output) e un consumo di token circa doppio rispetto ad altri modelli. L'approccio "ingegnere esperto" del modello, sebbene autonomo e meticoloso, può portare a un eccesso di dettagli in specifici tipi di output, rendendo il testo quasi illeggibile per specifiche e PRD, con blocchi densi e difficili da decifrare. Anche il design, per compiti one-shot, è risultato deludente, con output descritti come "fondamentalmente terribili". Claire suggerisce un uso strategico: Fable 5 è ideale per problemi tecnici complessi, lavoro a lungo termine e task di visione dove la precisione è fondamentale. Per front-end, strategia, specifiche e design, modelli più economici come Sonnet o Opus risultano più adatti. Viene anche menzionato che Fable 5 è una versione "baby Mythos", con guardrail di sicurezza non presenti nel modello non filtrato disponibile ai partner di Project Glasswing. Nel frattempo, Braintrust sta esplorando come gli agenti AI, le valutazioni (evals) e l'integrazione continua (CI) stiano migliorando lo sviluppo software. Ankur Goyal, CEO di Braintrust, sottolinea che i team più avanzati non usano l'AI solo per scrivere codice, ma per costruire i sistemi di feedback e benchmark che elevano la qualità del prodotto. Gli agenti, con la loro capacità di eseguire test rigorosi e continui, aumentano il livello di rigore e permettono di affrontare problemi infrastrutturali prima proibitivi per costi e rischi. Le "evals" sono descritte come il nuovo standard per definire il successo, spostando il focus dall'implementazione ai criteri di risultato misurabili. https://www.lennysnewsletter.com/p/how-i-ai-claude-fable-5-review-and Ultimo post che faccio sull'AI... (non è vero) #AI #IntelligenzaArtificiale #ModelliLinguistici
Sondaggio della Community

Qual è la tua opinione su questo argomento?

✉️

Rimani Aggiornato

Ricevi 1 meme + 1 pillola di analisi critica direttamente nella tua casella di posta. Zero spam, solo fatti e lucidità.