{"id":7161,"date":"2024-10-24T14:08:00","date_gmt":"2024-10-24T12:08:00","guid":{"rendered":"https:\/\/rafaelpatron.com\/blog\/marketing\/anthropic-computer-use-claude\/"},"modified":"2024-10-24T14:08:00","modified_gmt":"2024-10-24T12:08:00","slug":"anthropic-computer-use-claude","status":"publish","type":"post","link":"https:\/\/rafaelpatron.com\/blog\/ai\/anthropic-computer-use-claude\/","title":{"rendered":"Anthropic Computer Use: l&#8217;agente che muove il cursore al posto tuo"},"content":{"rendered":"<p>Anthropic ha rilasciato marted\u00ec la beta pubblica di Computer Use, una funzione che permette al nuovo Claude 3.5 Sonnet di muovere il cursore, cliccare, scrivere e navigare interfacce grafiche al posto dell&#8217;utente. \u00c8 il primo modello frontier che agisce sullo schermo come farebbe una persona. La beta \u00e8 disponibile via API, su Amazon Bedrock e su Google Cloud Vertex AI.<\/p>\n<p>Il salto va oltre il marketing. \u00c8 un cambio di categoria.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_86 counter-flat ez-toc-counter ez-toc-grey ez-toc-container-direction\">\n<div class=\"ez-toc-title-container\">\n<p class=\"ez-toc-title\" style=\"cursor:inherit\">Indice dei contenuti<\/p>\n<span class=\"ez-toc-title-toggle\"><a href=\"#\" class=\"ez-toc-pull-right ez-toc-btn ez-toc-btn-xs ez-toc-btn-default ez-toc-toggle\" aria-label=\"Toggle Table of Content\"><span class=\"ez-toc-js-icon-con\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Toggle<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #999;color:#999\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewBox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #999;color:#999\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewBox=\"0 0 24 24\" version=\"1.2\" baseProfile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/span><\/a><\/span><\/div>\n<nav><ul class='ez-toc-list ez-toc-list-level-1 ' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/rafaelpatron.com\/blog\/ai\/anthropic-computer-use-claude\/#come-funziona-davvero\" >Come funziona davvero<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/rafaelpatron.com\/blog\/ai\/anthropic-computer-use-claude\/#i-benchmark-che-anthropic-ha-pubblicato\" >I benchmark che Anthropic ha pubblicato<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/rafaelpatron.com\/blog\/ai\/anthropic-computer-use-claude\/#cosa-funziona-oggi-e-cosa-no\" >Cosa funziona oggi e cosa no<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/rafaelpatron.com\/blog\/ai\/anthropic-computer-use-claude\/#implicazioni-per-il-marketing-operativo\" >Implicazioni per il marketing operativo<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/rafaelpatron.com\/blog\/ai\/anthropic-computer-use-claude\/#il-problema-della-sicurezza-e-del-controllo\" >Il problema della sicurezza e del controllo<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/rafaelpatron.com\/blog\/ai\/anthropic-computer-use-claude\/#lipotesi-di-traiettoria-per-i-prossimi-dodici-mesi\" >L&#8217;ipotesi di traiettoria per i prossimi dodici mesi<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/rafaelpatron.com\/blog\/ai\/anthropic-computer-use-claude\/#quello-che-sto-consigliando-ai-clienti-questa-settimana\" >Quello che sto consigliando ai clienti questa settimana<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/rafaelpatron.com\/blog\/ai\/anthropic-computer-use-claude\/#cosa-significa-per-chi-sta-valutando-agenti-ai-in-azienda\" >Cosa significa per chi sta valutando agenti AI in azienda<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"come-funziona-davvero\"><\/span>Come funziona davvero<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Computer Use vede screenshot del desktop, ragiona sulla posizione degli elementi, e produce comandi di mouse e tastiera che vengono eseguiti localmente. L&#8217;utente avvia un task, Claude osserva, agisce, verifica il risultato, e procede al passo successivo. Il modello non controlla il sistema operativo: produce coordinate e azioni che un wrapper di sicurezza deve tradurre in eventi del sistema.<\/p>\n<p>In pratica: lo sviluppatore costruisce uno strato di esecuzione, il modello produce le decisioni. Il rischio \u00e8 esattamente dove ti aspetti: in mezzo a quello strato.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"i-benchmark-che-anthropic-ha-pubblicato\"><\/span>I benchmark che Anthropic ha pubblicato<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>OSWorld, il benchmark di riferimento per task computer-use in ambiente Linux con applicazioni reali, vede Claude 3.5 Sonnet al 14,9% di task completati correttamente. Per dare una proporzione: il modello migliore precedente si fermava al 7,8%. Le persone umane su OSWorld arrivano al 72,4%.<\/p>\n<p>Il numero ci dice due cose. Primo, il salto \u00e8 netto rispetto allo stato dell&#8217;arte di un mese fa. Secondo, siamo lontani dal poter delegare a un agente la gestione di workflow complessi senza supervisione costante.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"cosa-funziona-oggi-e-cosa-no\"><\/span>Cosa funziona oggi e cosa no<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Nei test che ho eseguito personalmente con un team di consulenti AI, Computer Use gestisce bene compiti come compilare form web standard, navigare un CRM con campi prevedibili, estrarre dati da una pagina visivamente densa. Si rompe regolarmente su: drag and drop precisi, gestione di pop-up modali che cambiano layout, scroll lunghi su pagine con caricamento dinamico.<\/p>\n<p>Anthropic stessa avverte nel post di lancio che il modello fatica con scrolling, drag, e azioni che richiedono coordinate millimetriche. La velocit\u00e0 \u00e8 il secondo limite: un task semplice come prenotare una sala riunioni su Google Calendar richiede tra i tre e i sei minuti, dove un umano impiega quaranta secondi.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"implicazioni-per-il-marketing-operativo\"><\/span>Implicazioni per il marketing operativo<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Negli ultimi giorni ho stilato una lista di task ricorrenti in agenzia che Computer Use potrebbe gestire entro sei mesi se la traiettoria di miglioramento resta questa. Ne cito quattro che valgono concretamente.<\/p>\n<p>Aggiornamento massivo di campagne Google Ads con varianti A\/B su asset estensione testo. Riconciliazione tra Analytics e CRM per identificare conversioni perse nel passaggio. Estrazione di insight da dashboard SaaS che non hanno API pubbliche (pi\u00f9 diffuse di quanto si pensi). Compilazione automatica di report client che oggi si fanno copia-incolla da quattro tab del browser.<\/p>\n<p>Tutte azioni che impegnano account manager per ore alla settimana. Non sono task creativi. Sono il volume noioso che brucia margine.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"il-problema-della-sicurezza-e-del-controllo\"><\/span>Il problema della sicurezza e del controllo<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Anthropic dedica met\u00e0 del post di lancio ai rischi: prompt injection da elementi visivi della pagina, possibilit\u00e0 che il modello esegua azioni distruttive non richieste, esfiltrazione di dati sensibili visibili sullo schermo. Le mitigazioni proposte sono sandboxing aggressivo, conferma umana per operazioni critiche, isolamento delle credenziali.<\/p>\n<p>Tradotto operativamente: oggi nessuno con la testa sulle spalle metterebbe Computer Use a girare con accesso al proprio account bancario o al CRM di produzione del cliente. La fase realistica \u00e8 ambiente di staging, dati di test, supervisione costante. Chi vende corsi su &#8220;automatizza la tua agenzia con Claude&#8221; sta facendo marketing, non operazioni.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"lipotesi-di-traiettoria-per-i-prossimi-dodici-mesi\"><\/span>L&#8217;ipotesi di traiettoria per i prossimi dodici mesi<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Anthropic ha aperto una strada. La domanda non \u00e8 se gli altri la seguiranno: \u00e8 in quanti mesi. OpenAI ha gi\u00e0 fatto trapelare nei mesi scorsi l&#8217;esistenza di un progetto interno per agenti che operano sul desktop. Google con Gemini ha capacit\u00e0 similari in stato sperimentale, mostrate in alcune demo selezionate.<\/p>\n<p>L&#8217;ipotesi realistica per i prossimi dodici mesi: entro fine 2025 avremo almeno tre modelli frontier con capacit\u00e0 di computer use mature, prestazioni nell&#8217;ordine del trentacinque per cento o pi\u00f9 su OSWorld, e prezzi unitari pi\u00f9 bassi di quelli attuali. Sar\u00e0 il momento in cui questi strumenti smetteranno di essere demo e inizieranno a essere infrastruttura di automazione operativa.<\/p>\n<p>Per chi opera lato cliente, il bivio \u00e8 oggi. O si comincia a mappare i workflow oggi, accettando che servono mesi di preparazione, o ci si trova nel 2026 ad assumere consulenti per fare il lavoro che si poteva fare in casa nel 2025. La scelta non \u00e8 teorica: \u00e8 una decisione di pianificazione delle risorse interne nei prossimi due trimestri.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"quello-che-sto-consigliando-ai-clienti-questa-settimana\"><\/span>Quello che sto consigliando ai clienti questa settimana<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Due azioni concrete, entrambe a basso costo, entrambe ad alto valore informativo per il pianificatore intelligente.<\/p>\n<p>Una: identificare i tre task ricorrenti pi\u00f9 costosi in ore senior che si svolgono in browser su sistemi conosciuti. Form di reportistica, aggiornamenti CRM, estrazioni da dashboard SaaS. Documentarli per iscritto, passo per passo, in modo che si possano trasformare in prompt operativi quando l&#8217;esecuzione sar\u00e0 affidabile.<\/p>\n<p>Due: avviare un piccolo esperimento controllato con Computer Use sulla beta attuale. Non per mettere in produzione, per imparare. Le competenze su prompt design per agenti, su gestione errori, su supervisione operativa, si costruiscono solo sbagliando in ambiente isolato. Chi parte oggi \u00e8 dodici mesi avanti su chi parte quando il prodotto sar\u00e0 maturo.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"cosa-significa-per-chi-sta-valutando-agenti-ai-in-azienda\"><\/span>Cosa significa per chi sta valutando agenti AI in azienda<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>La narrativa \u00e8 cambiata in trentasei ore. Fino a settembre la discussione era se gli agenti AI fossero pronti per task non triviali. Oggi \u00e8 quando lo saranno. La differenza per chi pianifica budget \u00e8 enorme.<\/p>\n<p>Il consiglio operativo: identifica ora i tre task ricorrenti in cui un agente che funziona al 60% farebbe la differenza, perch\u00e9 ti permetterebbe di liberare ore senior per lavoro che paga di pi\u00f9. Quando Computer Use o un suo successore arriver\u00e0 al 60%, quegli use case saranno gi\u00e0 mappati e pronti. Chi mappa adesso, \u00e8 dodici mesi avanti.<\/p>\n<p>Anthropic ha aperto una strada. La domanda non \u00e8 se gli altri la seguiranno: \u00e8 in quanti mesi.<\/p>\n","protected":false},"excerpt":{"rendered":"<p>Anthropic pubblica la beta di Computer Use con Claude 3.5 Sonnet. Prima funzione di agente che controlla mouse e tastiera. Implicazioni e limiti.<\/p>\n","protected":false},"author":10,"featured_media":2869,"comment_status":"","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"_wds_title":"Anthropic Computer Use: l'agente AI controlla il PC","_wds_metadesc":"Claude 3.5 Sonnet muove mouse e tastiera. OSWorld 14,9% (umani 72%). Cosa funziona oggi, cosa serve per delegare task reali al modello.","_wds_focus-keywords":"anthropic computer use","_wds_canonical":"","wds_primary_category":0,"footnotes":"","_wds_robots-noindex":"0","_wds_robots-nofollow":"0","_wds_opengraph-title":"","_wds_opengraph-description":"","_wds_twitter-title":"","_wds_twitter-description":""},"categories":[168],"tags":[473,470,474,471,472],"class_list":["post-7161","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai","tag-ai-agents","tag-anthropic","tag-automation","tag-claude","tag-computer-use"],"_links":{"self":[{"href":"https:\/\/rafaelpatron.com\/blog\/wp-json\/wp\/v2\/posts\/7161"}],"collection":[{"href":"https:\/\/rafaelpatron.com\/blog\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/rafaelpatron.com\/blog\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/rafaelpatron.com\/blog\/wp-json\/wp\/v2\/users\/10"}],"replies":[{"embeddable":true,"href":"https:\/\/rafaelpatron.com\/blog\/wp-json\/wp\/v2\/comments?post=7161"}],"version-history":[{"count":0,"href":"https:\/\/rafaelpatron.com\/blog\/wp-json\/wp\/v2\/posts\/7161\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/rafaelpatron.com\/blog\/wp-json\/wp\/v2\/media\/2869"}],"wp:attachment":[{"href":"https:\/\/rafaelpatron.com\/blog\/wp-json\/wp\/v2\/media?parent=7161"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/rafaelpatron.com\/blog\/wp-json\/wp\/v2\/categories?post=7161"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/rafaelpatron.com\/blog\/wp-json\/wp\/v2\/tags?post=7161"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}