{"id":7160,"date":"2024-09-17T10:23:00","date_gmt":"2024-09-17T08:23:00","guid":{"rendered":"https:\/\/rafaelpatron.com\/blog\/marketing\/openai-o1-modelli-ragionamento\/"},"modified":"2024-09-17T10:23:00","modified_gmt":"2024-09-17T08:23:00","slug":"openai-o1-modelli-ragionamento","status":"publish","type":"post","link":"https:\/\/rafaelpatron.com\/blog\/ai\/openai-o1-modelli-ragionamento\/","title":{"rendered":"OpenAI o1 e la nuova generazione di modelli di ragionamento"},"content":{"rendered":"<p>OpenAI ha pubblicato la scorsa settimana o1-preview e o1-mini, i primi modelli del laboratorio di San Francisco che spendono token espliciti per ragionare prima di rispondere. Il salto sui benchmark \u00e8 netto. AIME 2024, l&#8217;olimpiade matematica americana, passa dal 13% di GPT-4o all&#8217;83% di o1. Codeforces lo posiziona nell&#8217;89\u00b0 percentile dei programmatori competitivi umani.<\/p>\n<p>Il punto non \u00e8 il numero. Il punto \u00e8 cosa lo produce.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_86 counter-flat ez-toc-counter ez-toc-grey ez-toc-container-direction\">\n<div class=\"ez-toc-title-container\">\n<p class=\"ez-toc-title\" style=\"cursor:inherit\">Indice dei contenuti<\/p>\n<span class=\"ez-toc-title-toggle\"><a href=\"#\" class=\"ez-toc-pull-right ez-toc-btn ez-toc-btn-xs ez-toc-btn-default ez-toc-toggle\" aria-label=\"Toggle Table of Content\"><span class=\"ez-toc-js-icon-con\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Toggle<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #999;color:#999\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewBox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #999;color:#999\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewBox=\"0 0 24 24\" version=\"1.2\" baseProfile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/span><\/a><\/span><\/div>\n<nav><ul class='ez-toc-list ez-toc-list-level-1 ' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/rafaelpatron.com\/blog\/ai\/openai-o1-modelli-ragionamento\/#cosa-fa-o1-di-diverso\" >Cosa fa o1 di diverso<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/rafaelpatron.com\/blog\/ai\/openai-o1-modelli-ragionamento\/#i-numeri-sui-benchmark-scientifici\" >I numeri sui benchmark scientifici<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/rafaelpatron.com\/blog\/ai\/openai-o1-modelli-ragionamento\/#quanto-costa-pensare\" >Quanto costa pensare<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/rafaelpatron.com\/blog\/ai\/openai-o1-modelli-ragionamento\/#dove-ha-senso-usarlo-nel-marketing\" >Dove ha senso usarlo nel marketing<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/rafaelpatron.com\/blog\/ai\/openai-o1-modelli-ragionamento\/#o1-mini-la-variante-che-probabilmente-userai\" >o1-mini, la variante che probabilmente userai<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/rafaelpatron.com\/blog\/ai\/openai-o1-modelli-ragionamento\/#le-tre-cose-che-cambieranno-nei-prossimi-mesi\" >Le tre cose che cambieranno nei prossimi mesi<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/rafaelpatron.com\/blog\/ai\/openai-o1-modelli-ragionamento\/#quello-che-gli-analisti-finanziari-stanno-ignorando\" >Quello che gli analisti finanziari stanno ignorando<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/rafaelpatron.com\/blog\/ai\/openai-o1-modelli-ragionamento\/#la-domanda-strategica-che-pochi-stanno-facendo\" >La domanda strategica che pochi stanno facendo<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"cosa-fa-o1-di-diverso\"><\/span>Cosa fa o1 di diverso<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>I modelli precedenti sono addestrati per dare la risposta migliore al primo tentativo. o1 introduce una fase computazionale separata: prima della risposta visibile genera una sequenza di reasoning tokens che restano nascosti all&#8217;utente ma vengono fatturati come gli altri. La risposta finale \u00e8 il risultato di una catena di passaggi intermedi, esattamente come uno studente di dottorato scriverebbe sulla lavagna prima di consegnare.<\/p>\n<p>OpenAI parla di chain-of-thought interno. Tradotto: il modello pensa pi\u00f9 a lungo, usa pi\u00f9 calcolo per query, e quando la domanda lo merita produce risposte qualitativamente diverse. Quando la domanda non lo merita, sta bruciando soldi tuoi.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"i-numeri-sui-benchmark-scientifici\"><\/span>I numeri sui benchmark scientifici<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>I dati pubblicati da OpenAI sul technical blog parlano chiaro. GPQA Diamond, set di domande di livello dottorale in fisica, biologia e chimica: o1 supera la performance media degli esperti nelle rispettive discipline. Olimpiadi internazionali di programmazione: o1 si qualifica nei finali. Logica formale, contest matematici, ragionamento simbolico: stato dell&#8217;arte.<\/p>\n<p>Quello che non dicono ad alta voce \u00e8 il rovescio. Su task generativi standard, come la scrittura di marketing copy, la rielaborazione di brief, la sintesi di documenti, o1 non \u00e8 meglio di GPT-4o. In alcuni casi \u00e8 peggio, perch\u00e9 il reasoning aggiuntivo introduce verbosit\u00e0 dove non serve.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"quanto-costa-pensare\"><\/span>Quanto costa pensare<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>o1-preview parte da 15 dollari per milione di token in input e 60 dollari per milione in output. A questi costi si aggiungono i reasoning tokens, fatturati allo stesso prezzo dei tokens di risposta visibile. In test che ho eseguito su prompt analitici realistici, una singola query consuma tra 2.000 e 8.000 reasoning tokens prima della risposta.<\/p>\n<p>Per dare una proporzione: una query analitica su o1-preview costa quattro fino a dieci volte una stessa query su GPT-4o. La latenza media \u00e8 circa 20-40 secondi contro i 3-5 secondi di GPT-4o.<\/p>\n<p>Per un assistente conversazionale in produzione, \u00e8 impraticabile. Per uno script batch su duecento problemi di matematica finanziaria, ha un senso preciso.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"dove-ha-senso-usarlo-nel-marketing\"><\/span>Dove ha senso usarlo nel marketing<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Lavoro con team che eseguono analisi di attribution complesse, modelli di customer lifetime value, segmentazione su dataset estesi. Per questo genere di task o1 produce un differenziale reale: la chain-of-thought intercetta errori logici che i modelli precedenti facevano in silenzio.<\/p>\n<p>Il problema vero \u00e8 capire dove allocare il budget tra modelli. Non tutto va bene per o1. Quasi nulla, in marketing operativo quotidiano. Una landing page non si scrive con o1. Un piano di automation a livello di logica condizionale, s\u00ec.<\/p>\n<p>Spoiler: nei flussi reali serviranno entrambi nel routing della tua applicazione, fino a quando OpenAI non automatizzer\u00e0 la scelta per te.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"o1-mini-la-variante-che-probabilmente-userai\"><\/span>o1-mini, la variante che probabilmente userai<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>o1-mini costa 3 dollari per milione di token input e 12 per milione output. Specializzato su STEM, \u00e8 la versione che ha pi\u00f9 senso integrare nei workflow produttivi. Non ha la generalit\u00e0 di o1-preview, ma su task codificati come la scrittura di funzioni Python con casi limite o il debug di logiche di tracking analytics si difende bene.<\/p>\n<p>Per chi lavora in agenzia con sviluppo interno o consulenza tecnica, o1-mini \u00e8 il candidato pi\u00f9 realistico per integrazioni nel flusso. Per chi vende solo creativit\u00e0 testuale, l&#8217;arsenale resta GPT-4o con prompting strutturato.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"le-tre-cose-che-cambieranno-nei-prossimi-mesi\"><\/span>Le tre cose che cambieranno nei prossimi mesi<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Prima: gli altri laboratori risponderanno. Anthropic ha rilasciato Claude 3.5 Sonnet a giugno, ma senza una capacit\u00e0 di reasoning esteso comparabile come fase dedicata di prodotto. Google con Gemini 1.5 ha contesto lungo ma non chain-of-thought esposta come modalit\u00e0. Aspettatevi entro fine anno aggiornamenti orientati al reasoning da entrambi.<\/p>\n<p>Seconda: la pressione sui costi. I sessanta dollari per milione di token output sono un prezzo di lancio. Quando il mercato avr\u00e0 tre o quattro modelli reasoning competitivi, il prezzo scender\u00e0. Le applicazioni che oggi non hanno senso economico domani ne avranno. Pianificare proof of concept tenendo conto che il costo unitario caler\u00e0 del settanta per cento in dodici mesi \u00e8 realismo, non ottimismo.<\/p>\n<p>Terza: la conversazione su quale modello scegliere diventer\u00e0 pi\u00f9 sofisticata. Stiamo entrando in una fase dove non esiste pi\u00f9 il modello migliore in assoluto. Esiste una matrice di modelli con capacit\u00e0 diverse, prezzi diversi, latenze diverse. Chi sviluppa applicazioni AI deve costruire architetture che instradano dinamicamente la query al modello giusto. Non \u00e8 un dettaglio tecnico, \u00e8 un fattore competitivo.<\/p>\n<p>La metrica utile da costruire in azienda nei prossimi mesi \u00e8 il costo per decisione corretta, non il costo per token. \u00c8 una differenza non banale. Un task analitico che con GPT-4o costa cinquanta centesimi ma richiede tre iterazioni di verifica umana (totale: due ore di senior) \u00e8 oggettivamente pi\u00f9 caro di uno stesso task che con o1 costa quattro euro e produce risultato corretto al primo passaggio. La fattura cloud non racconta la storia completa.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"quello-che-gli-analisti-finanziari-stanno-ignorando\"><\/span>Quello che gli analisti finanziari stanno ignorando<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Una nota laterale sulle valutazioni. NVIDIA ha tenuto il prezzo nei giorni successivi al lancio di o1. La ragione \u00e8 semplice: reasoning esteso significa pi\u00f9 calcolo per query, non meno. Anche se il numero di query non cresce, il consumo di GPU per inference cresce strutturalmente. Per chi compra azioni di provider hardware, la storia che o1 fa male a NVIDIA \u00e8 una lettura miope.<\/p>\n<p>Per chi compra AI a livello di prodotto, la conseguenza opposta. I costi di inference cresceranno per i task in cui il reasoning paga. Le applicazioni che dipendono da AI come commodity verranno sotto pressione di margine. Quelle che vendono valore verticale, no.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"la-domanda-strategica-che-pochi-stanno-facendo\"><\/span>La domanda strategica che pochi stanno facendo<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>OpenAI dichiara che o1 \u00e8 l&#8217;inizio di una famiglia. La prossima generazione potrebbe rendere il ragionamento esteso una commodity, abbassare i costi di un ordine di grandezza, e a quel punto la matematica cambia per chiunque costruisca prodotti AI-powered.<\/p>\n<p>Chi oggi prototipa con o1-mini in modalit\u00e0 esplorazione sta costruendo l&#8217;asset pi\u00f9 importante: capire cosa il modello fa bene e cosa no, sui dati reali del proprio business. Chi aspetta che diventi conveniente, scoprir\u00e0 di doverlo imparare quando tutti gli altri lo avranno gi\u00e0 imparato.<\/p>\n","protected":false},"excerpt":{"rendered":"<p>OpenAI pubblica o1-preview e o1-mini. Primi modelli con catena di ragionamento visibile come token. Cosa cambia davvero per il marketing analitico.<\/p>\n","protected":false},"author":10,"featured_media":2958,"comment_status":"","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"_wds_title":"OpenAI o1: reasoning AI, benchmark e costi reali","_wds_metadesc":"OpenAI o1-preview e o1-mini introducono i reasoning tokens. AIME 83%, Codeforces 89\u00b0 percentile. Quando ha senso usarlo, quando \u00e8 solo costo.","_wds_focus-keywords":"openai o1","_wds_canonical":"","wds_primary_category":0,"footnotes":"","_wds_robots-noindex":"0","_wds_robots-nofollow":"0","_wds_opengraph-title":"","_wds_opengraph-description":"","_wds_twitter-title":"","_wds_twitter-description":""},"categories":[168],"tags":[169,469,467,453,468],"class_list":["post-7160","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai","tag-ai","tag-modelli-ai","tag-o1","tag-openai","tag-reasoning"],"_links":{"self":[{"href":"https:\/\/rafaelpatron.com\/blog\/wp-json\/wp\/v2\/posts\/7160"}],"collection":[{"href":"https:\/\/rafaelpatron.com\/blog\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/rafaelpatron.com\/blog\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/rafaelpatron.com\/blog\/wp-json\/wp\/v2\/users\/10"}],"replies":[{"embeddable":true,"href":"https:\/\/rafaelpatron.com\/blog\/wp-json\/wp\/v2\/comments?post=7160"}],"version-history":[{"count":0,"href":"https:\/\/rafaelpatron.com\/blog\/wp-json\/wp\/v2\/posts\/7160\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/rafaelpatron.com\/blog\/wp-json\/wp\/v2\/media\/2958"}],"wp:attachment":[{"href":"https:\/\/rafaelpatron.com\/blog\/wp-json\/wp\/v2\/media?parent=7160"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/rafaelpatron.com\/blog\/wp-json\/wp\/v2\/categories?post=7160"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/rafaelpatron.com\/blog\/wp-json\/wp\/v2\/tags?post=7160"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}