{"id":7168,"date":"2025-09-30T15:38:00","date_gmt":"2025-09-30T13:38:00","guid":{"rendered":"https:\/\/rafaelpatron.com\/blog\/marketing\/claude-sonnet-4-5-task-lunghi\/"},"modified":"2025-09-30T15:38:00","modified_gmt":"2025-09-30T13:38:00","slug":"claude-sonnet-4-5-task-lunghi","status":"publish","type":"post","link":"https:\/\/rafaelpatron.com\/blog\/ai\/claude-sonnet-4-5-task-lunghi\/","title":{"rendered":"Claude Sonnet 4.5 e la stabilit\u00e0 sui task lunghi che mancava"},"content":{"rendered":"<p>Anthropic ha rilasciato ieri Claude Sonnet 4.5, descritto nel blog ufficiale come il miglior modello al mondo per task agentici di lunga durata. Il dato che fa rumore: nei benchmark interni dichiarati, sessioni autonome di trenta ore continuative senza il degrado prestazionale che affliggeva tutti i modelli precedenti. SWE-bench Verified al 77,2%, OSWorld al 61,4%, performance superiore a Sonnet 4 e a confronto diretto con Opus 4.1.<\/p>\n<p>I numeri sono la parte facile. Il significato operativo \u00e8 dove cambia il gioco.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_86 counter-flat ez-toc-counter ez-toc-grey ez-toc-container-direction\">\n<div class=\"ez-toc-title-container\">\n<p class=\"ez-toc-title\" style=\"cursor:inherit\">Indice dei contenuti<\/p>\n<span class=\"ez-toc-title-toggle\"><a href=\"#\" class=\"ez-toc-pull-right ez-toc-btn ez-toc-btn-xs ez-toc-btn-default ez-toc-toggle\" aria-label=\"Toggle Table of Content\"><span class=\"ez-toc-js-icon-con\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Toggle<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #999;color:#999\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewBox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #999;color:#999\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewBox=\"0 0 24 24\" version=\"1.2\" baseProfile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/span><\/a><\/span><\/div>\n<nav><ul class='ez-toc-list ez-toc-list-level-1 ' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/rafaelpatron.com\/blog\/ai\/claude-sonnet-4-5-task-lunghi\/#il-problema-dei-task-lunghi-che-pochi-raccontano\" >Il problema dei task lunghi che pochi raccontano<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/rafaelpatron.com\/blog\/ai\/claude-sonnet-4-5-task-lunghi\/#cosa-significano-30-ore-di-task-autonomo\" >Cosa significano 30 ore di task autonomo<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/rafaelpatron.com\/blog\/ai\/claude-sonnet-4-5-task-lunghi\/#cosa-significa-per-marketing-automation-reale\" >Cosa significa per marketing automation reale<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/rafaelpatron.com\/blog\/ai\/claude-sonnet-4-5-task-lunghi\/#quello-che-funziona-e-quello-che-ancora-no\" >Quello che funziona e quello che ancora no<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/rafaelpatron.com\/blog\/ai\/claude-sonnet-4-5-task-lunghi\/#limplicazione-strategica-per-chi-compra-ai\" >L&#8217;implicazione strategica per chi compra AI<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/rafaelpatron.com\/blog\/ai\/claude-sonnet-4-5-task-lunghi\/#anthropic-come-anomalia-nel-mercato\" >Anthropic come anomalia nel mercato<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/rafaelpatron.com\/blog\/ai\/claude-sonnet-4-5-task-lunghi\/#quello-che-la-concorrenza-dovra-fare-nei-prossimi-mesi\" >Quello che la concorrenza dovr\u00e0 fare nei prossimi mesi<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/rafaelpatron.com\/blog\/ai\/claude-sonnet-4-5-task-lunghi\/#cosa-farei-se-gestissi-oggi-unagenzia-ai-first\" >Cosa farei se gestissi oggi un&#8217;agenzia AI-first<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"il-problema-dei-task-lunghi-che-pochi-raccontano\"><\/span>Il problema dei task lunghi che pochi raccontano<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Chiunque abbia provato a far girare un agente AI su un workflow che dura pi\u00f9 di quaranta minuti conosce il fenomeno. Inizia bene. Continua decente. Verso la met\u00e0 perde il filo del piano iniziale. Verso la fine produce output sconnessi dal punto di partenza. Si chiama context degradation, o pi\u00f9 colloquialmente &#8220;agent fatigue&#8221;, e ha tenuto inchiodate al banco delle prove buona parte delle promesse sugli agenti AI fatte tra fine 2024 e met\u00e0 2025.<\/p>\n<p>Sonnet 4.5 affronta questo problema in modo strutturale. Anthropic descrive nel technical post miglioramenti su tre fronti: memoria di lavoro pi\u00f9 stabile, capacit\u00e0 di rivedere il proprio piano quando il contesto cambia, gestione esplicita di sub-goal con checkpoint intermedi.<\/p>\n<p>Non \u00e8 magia. \u00c8 ingegneria del modello tarata su workflow reali, non pi\u00f9 solo su benchmark accademici.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"cosa-significano-30-ore-di-task-autonomo\"><\/span>Cosa significano 30 ore di task autonomo<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Anthropic ha mostrato un esempio concreto nel post di lancio: un agente che ha costruito un&#8217;applicazione Slack-clone funzionante in trenta ore di lavoro autonomo. Non parliamo di prototipo da hackathon, parliamo di codebase di migliaia di righe con frontend, backend, database, gestione utenti. Funzionante.<\/p>\n<p>L&#8217;esempio \u00e8 del laboratorio. Va preso per quello che \u00e8: un test controllato, non un caso d&#8217;uso pronto per essere replicato in agenzia il luned\u00ec mattina. Comunque, il segnale \u00e8 chiaro. La barriera tra &#8220;agente AI&#8221; e &#8220;stagista che esegue da solo un compito lungo&#8221; si sta abbassando di mesi in mesi.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"cosa-significa-per-marketing-automation-reale\"><\/span>Cosa significa per marketing automation reale<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Lavoro con team marketing su workflow che oggi richiedono persone senior per ore: audit SEO multi-pagina di un sito enterprise, analisi competitor su quindici concorrenti, costruzione di topic cluster su mille keyword, riconciliazione dati cross-platform per attribution model.<\/p>\n<p>Questi sono i casi dove Sonnet 4.5 vale il prezzo del biglietto. Non perch\u00e9 sostituisce la persona senior, ma perch\u00e9 la libera dal volume noioso e la lascia su decisioni e strategia. La matematica \u00e8 stata sempre questa, mancava lo strumento abbastanza stabile per renderla operativa.<\/p>\n<p>Nei test che ho fatto in queste prime trentasei ore con Claude Code (l&#8217;ambiente di sviluppo agentico di Anthropic), l&#8217;agente ha completato senza intervento umano task di analisi competitiva su otto siti che impegnavano un account senior per circa sei ore. Tempo macchina: novanta minuti. Costo in token: meno di tre dollari.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"quello-che-funziona-e-quello-che-ancora-no\"><\/span>Quello che funziona e quello che ancora no<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Quattro categorie di task dove Sonnet 4.5 si difende eccellentemente nei miei test pratici: estrazione dati strutturati da pagine web non standardizzate, analisi comparativa di documenti lunghi, generazione di report tecnici con citazioni accurate, refactoring di codebase mediamente complesse.<\/p>\n<p>Tre categorie dove ancora va supervisionato: scrittura long-form di pezzi editoriali (tende a un certo livello di omogeneit\u00e0 stilistica difficile da sradicare), decisioni che richiedono giudizio di mercato verticale (ad esempio strategia di pricing su settori specifici), task multi-agente in cui Claude deve coordinare altri Claude (la coordinazione cross-istanza \u00e8 ancora fragile).<\/p>\n<h2><span class=\"ez-toc-section\" id=\"limplicazione-strategica-per-chi-compra-ai\"><\/span>L&#8217;implicazione strategica per chi compra AI<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Sonnet 4.5 sposta in avanti il confine tra &#8220;AI che assiste&#8221; e &#8220;AI che esegue&#8221;. \u00c8 una distinzione operativa con conseguenze contrattuali precise.<\/p>\n<p>Quando l&#8217;AI assiste, la responsabilit\u00e0 resta sul professionista che usa l&#8217;output. Quando l&#8217;AI esegue, la responsabilit\u00e0 si distribuisce: chi ha configurato l&#8217;agente, chi ha approvato la configurazione, chi ne supervisiona i risultati. I contratti di servizio devono adeguarsi, le polizze professionali devono adeguarsi, le procedure di audit devono adeguarsi.<\/p>\n<p>Per chi opera in Italia in settori regolati, \u00e8 il momento di rivedere il proprio inquadramento. Le associazioni di categoria del settore AI come <a href=\"https:\/\/aipia.it\/\">AIPIA<\/a> stanno lavorando da mesi su standard di qualifica per i professionisti che operano con agenti AI in produzione, e nei prossimi mesi questo lavoro arriver\u00e0 a output utilizzabili.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"anthropic-come-anomalia-nel-mercato\"><\/span>Anthropic come anomalia nel mercato<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Una nota strategica sul lato Anthropic. Il laboratorio californiano sta pubblicando aggiornamenti rilevanti a un ritmo che resta pi\u00f9 lento di OpenAI e Google, ma con coerenza tematica notevole. Ogni rilascio Anthropic \u00e8 centrato su un tema: a giugno la sicurezza interpretabile, ad agosto il coding agentico, a settembre i task lunghi.<\/p>\n<p>OpenAI rilascia un sistema generalista che cerca di vincere su tutto. Google rilascia integrazioni nel proprio ecosistema. Anthropic rilascia capacit\u00e0 specifiche con benchmark verticali. Sono tre tesi di prodotto diverse.<\/p>\n<p>Per chi sceglie il proprio stack AI, la domanda \u00e8: il mio caso d&#8217;uso ha pi\u00f9 senso su un sistema-tutto, sull&#8217;ecosistema integrato, o su un modello focalizzato su una capacit\u00e0 precisa. Non c&#8217;\u00e8 risposta universale. C&#8217;\u00e8 una valutazione che ogni azienda deve fare sui propri workflow reali.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"quello-che-la-concorrenza-dovra-fare-nei-prossimi-mesi\"><\/span>Quello che la concorrenza dovr\u00e0 fare nei prossimi mesi<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Una nota strategica su come questa release pesa sulla concorrenza. OpenAI ha appena rilasciato GPT-5 ad agosto con il proprio sistema di routing automatico, ma su task agentici di lunga durata Anthropic mantiene un vantaggio percepibile nelle valutazioni indipendenti. Google con Gemini 2.5 Pro \u00e8 competitiva sui benchmark, meno sulla stabilit\u00e0 in sessioni estese.<\/p>\n<p>La domanda per chi compra \u00e8 dove sta andando il mercato. La mia tesi: i prossimi sei mesi vedranno una convergenza su capacit\u00e0 agentiche. Tutti i grandi laboratori pubblicheranno modelli capaci di task lunghi entro inizio 2026. Il differenziale torner\u00e0 a giocarsi su tre fattori: costo unitario, integrazione con ecosistemi (Workspace, Microsoft, Slack), affidabilit\u00e0 su domini specifici.<\/p>\n<p>Per chi pianifica oggi, due principi utili. Prima, non bloccarsi su un fornitore unico per ragioni emotive: la mappa cambier\u00e0 di nuovo. Seconda, non costruire applicazioni vertical-locked sulle capacit\u00e0 specifiche di una singola release. La portabilit\u00e0 \u00e8 il vero asset.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"cosa-farei-se-gestissi-oggi-unagenzia-ai-first\"><\/span>Cosa farei se gestissi oggi un&#8217;agenzia AI-first<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Tre azioni concrete questa settimana.<\/p>\n<p>Uno: identificare i tre task ricorrenti pi\u00f9 costosi in tempo senior. Se uno \u00e8 di natura analitica multi-step e impiega pi\u00f9 di due ore a settimana di un account senior, \u00e8 un candidato per Sonnet 4.5.<\/p>\n<p>Due: prototipare in cinque giorni l&#8217;automazione di quel task. Non in produzione, in sandbox. Misurare scarto qualitativo e tempo risparmiato.<\/p>\n<p>Tre: se il prototipo regge, definire la procedura di supervisione umana e portarlo in produzione con metriche chiare. Se non regge, conservare l&#8217;esperienza per il prossimo trimestre. Sonnet 4.6 arriver\u00e0, e ogni release dei prossimi sei mesi ridurr\u00e0 la distanza tra &#8220;non ancora&#8221; e &#8220;s\u00ec, oggi&#8221;.<\/p>\n<p>Chi aspetta che la tecnologia sia matura prima di provarla, sar\u00e0 un anno indietro quando lo sar\u00e0 davvero.<\/p>\n","protected":false},"excerpt":{"rendered":"<p>Anthropic rilascia Claude Sonnet 4.5 con miglioramenti su task agentici di lunga durata. Sessioni di 30 ore senza degrado. Implicazioni per workflow marketing automation reale.<\/p>\n","protected":false},"author":10,"featured_media":5435,"comment_status":"","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"_wds_title":"Claude Sonnet 4.5: 30 ore di task autonomi senza degrado","_wds_metadesc":"Anthropic pubblica Sonnet 4.5. SWE-bench 77,2%, OSWorld 61,4%, sessioni di 30 ore stabili. Cosa cambia per marketing automation e agenti reali.","_wds_focus-keywords":"claude sonnet 4.5","_wds_canonical":"","wds_primary_category":0,"footnotes":"","_wds_robots-noindex":"0","_wds_robots-nofollow":"0","_wds_opengraph-title":"","_wds_opengraph-description":"","_wds_twitter-title":"","_wds_twitter-description":""},"categories":[168],"tags":[473,470,471,495,496],"class_list":["post-7168","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai","tag-ai-agents","tag-anthropic","tag-claude","tag-sonnet-45","tag-task-automation"],"_links":{"self":[{"href":"https:\/\/rafaelpatron.com\/blog\/wp-json\/wp\/v2\/posts\/7168"}],"collection":[{"href":"https:\/\/rafaelpatron.com\/blog\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/rafaelpatron.com\/blog\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/rafaelpatron.com\/blog\/wp-json\/wp\/v2\/users\/10"}],"replies":[{"embeddable":true,"href":"https:\/\/rafaelpatron.com\/blog\/wp-json\/wp\/v2\/comments?post=7168"}],"version-history":[{"count":0,"href":"https:\/\/rafaelpatron.com\/blog\/wp-json\/wp\/v2\/posts\/7168\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/rafaelpatron.com\/blog\/wp-json\/wp\/v2\/media\/5435"}],"wp:attachment":[{"href":"https:\/\/rafaelpatron.com\/blog\/wp-json\/wp\/v2\/media?parent=7168"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/rafaelpatron.com\/blog\/wp-json\/wp\/v2\/categories?post=7168"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/rafaelpatron.com\/blog\/wp-json\/wp\/v2\/tags?post=7168"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}