Sfoglia altri articoli simili con le etichette:
I Custom GPT di OpenAI si costruiscono in dieci minuti. Quasi nessuno li costruisce bene.
Il problema non è il tool. È il metodo.
La tone of voice di un marchio non si descrive con tre aggettivi presi da un brief PowerPoint del 2018. Si estrae da un archivio testuale concreto, si distilla in regole operative, si testa contro casi limite. Tutto il resto è cosmetica. E si vede.
Perché un Custom GPT standard scrive come tutti gli altri
Il primo errore è il prompt iniziale. La maggior parte dei marketer scrive qualcosa del tipo: “Sei un assistente che scrive nello stile del nostro brand. Il tono è amichevole, professionale, autorevole”. Questo prompt non funziona. Quelle tre etichette descrivono il 90 per cento dei brand italiani e l’output di default di ChatGPT.
Il modello di base ha già una sua tone of voice predefinita. Quella di un assistente cortese, neutro, leggermente accademico, con tendenza al bullet point e al disclaimer. Se non lo sposti con istruzioni specifiche, quello scrive. Sempre.
Quando ho lavorato sul Custom GPT di un cliente nel food italiano, abbiamo passato tre settimane prima sull’estrazione del corpus e poi sulle istruzioni. Il risultato finale: prompt di sistema da 1.847 parole, knowledge base con 23 file, un ciclo di test su 40 prompt di controllo. Da lì in poi il GPT produce testi che il copy interno fa fatica a distinguere dai propri. Questo è il livello a cui un Custom GPT inizia ad avere senso. Sotto, è un giocattolo.
Estrarre la tone of voice da un archivio reale
Niente brief. Niente brand guidelines aggiornate al 2019. Si parte dai testi che il brand ha già prodotto e che hanno funzionato.
Servono almeno trenta pezzi di contenuto: post social, newsletter, articoli, pagine prodotto, descrizioni catalogo. Più sono, meglio è. Importante: solo testi degli ultimi diciotto mesi, e solo scritti dalla persona o dal team che gestisce attualmente la comunicazione. Testi vecchi di copywriter freelance del 2019 sporcano l’analisi e portano il GPT a imitare una voce che il brand non usa più.
Il prompt che uso per l’estrazione, da incollare in una chat ChatGPT nuova insieme ai trenta testi:
“Analizza i testi che ti passo. Sono produzione editoriale del brand X degli ultimi diciotto mesi. Ti chiedo cinque output distinti. Primo: lessico ricorrente, parole concettuali usate più di tre volte nel corpus. Secondo: parole bandite, termini plausibili nel settore che NON compaiono mai. Terzo: struttura sintattica tipica, lunghezza media frasi, ricorrenza di subordinate, parentetiche, domande. Quarto: registro emotivo, dove si colloca tra ironia, gravità, calore, distanza. Quinto: cinque esempi di apertura tipica e cinque di chiusura tipica, riportati testualmente. Nessun commento generale, solo dati.”
L’output di questo prompt è materia prima per il system prompt vero. Non è ancora il system prompt. Va riletto a mano, rifinito, integrato con conoscenza implicita che il modello non riesce a estrarre dai soli testi (politica editoriale, vincoli di marca, tabù settoriali).
Questa logica vale per qualsiasi esercizio di tone of voice ben fatto, non solo per il GPT. Cambia solo il deliverable finale.
Il system prompt che funziona davvero
Il system prompt di un Custom GPT serio sta tra le 1.200 e le 2.500 parole. Sotto, è generico. Sopra, il modello inizia a perdere il filo nelle istruzioni intermedie e fa finta di non averle lette.
La struttura che uso, cinque blocchi.
Identità e contesto. Chi è il GPT, per chi scrive, in che canale. Esempio: “Sei l’assistente di scrittura interno del brand X, che opera nel settore Y. Il tuo output va in newsletter B2B verso buyer di catene retail. Non scrivere mai per consumatori finali”.
Lessico operativo. Lista esplicita di parole preferite, lista esplicita di parole bandite. Almeno quindici voci per parte. Le parole bandite sono il pezzo a più alto ROI dell’intero prompt, perché tagliano subito i tic AI peggiori. La lista bandita può includere termini specifici del settore che il brand evita per posizionamento (per esempio un brand di alimentari premium che non usa mai la parola “economico”).
Struttura sintattica. Indicazioni sulla lunghezza media delle frasi, sull’uso dei paragrafi, sulla presenza di esempi concreti. “Alterna paragrafi di 4-6 righe a paragrafi di 1-2 righe. Frase media diciotto parole. Una frase su sette sotto le dieci parole”.
Casi d’uso e priorità. Cosa fai, cosa non fai. “Se chiedo un testo per una landing, produci anche tre varianti di H1 e una meta description. Se chiedo di rispondere a un commento social, produci tre opzioni a tono differente”.
Regole di refusal e disambiguazione. Cosa fare quando manca contesto. “Se il brief è ambiguo, fai due domande prima di produrre. Mai chiedere più di due domande. Se il tema non è coerente con il settore Y, segnalalo e proponi una riformulazione”.
La quinta sezione la sottovalutano tutti, ed è quella che evita le risposte vaghe quando l’utente è impreciso. È il punto su cui ho riscritto il prompt più volte in quasi ogni progetto che ho seguito sul fronte del prompt engineering applicato al marketing. Senza disambiguazione, il GPT inventa per riempire i vuoti. Con la disambiguazione, chiede e poi scrive.
La knowledge base, cosa caricare e cosa no
OpenAI permette fino a venti file di knowledge base. La tentazione è caricare tutto. Sbagliato.
Il modello non legge i file in modo lineare. Fa retrieval su chunk semantici. Se carico cinquanta PDF di white paper, il GPT pesca chunk casuali che possono finire fuori contesto rispetto alla richiesta. Meno file, ma curati, funzionano meglio. Sempre.
Cosa caricare, in ordine di priorità:
- Brand guidelines aggiornate, in PDF o TXT pulito
- Dieci-quindici testi esemplari del brand, etichettati come “esempi di output corretto”
- Glossario interno con definizioni operative dei termini di settore
- Documento separato “errori frequenti”, con esempi di output sbagliati e versione corretta accanto
- Eventuale listino prezzi se il GPT deve produrre contenuti commerciali
Cosa non caricare: archivio storico completo, slide di vendita, materiali confidenziali clienti, dataset Excel. Per i numeri si usa il browsing oppure si passano direttamente nel prompt utente. Lo storico va selezionato a mano: dei tre anni di newsletter pubblicate, ne carichi le dieci più rappresentative, non tutte.
Un dettaglio operativo che fa differenza concreta. I file della knowledge base vanno nominati con etichette descrittive (“esempi_apertura_newsletter.txt”) e non con i nomi originali dei file aziendali (“NL_2024_v3_finale_OK.docx”). Il GPT usa il filename come hint di retrieval, e nomi chiari guidano meglio il match semantico durante le query. Sembra un dettaglio, in pratica sposta la qualità del retrieval del dieci-quindici per cento.
Il ciclo di test che taglia i refusi
Una volta costruito il GPT, va testato su un set di prompt di controllo. Non sui prompt che useremo dopo, ma su prompt deliberatamente difficili.
Ne uso quaranta, divisi in quattro categorie. Prompt standard del flusso quotidiano. Prompt ambigui. Prompt fuori contesto. Prompt che provano a forzare il tono in direzione opposta. Ogni prompt va eseguito tre volte. Se su quaranta prompt il GPT produce output coerente almeno trentadue volte, è pronto. Sotto, si torna al system prompt.
I fallimenti tipici da correggere: il GPT inizia ancora con domande retoriche. Usa parole bandite. Scivola sul registro neutro standard ChatGPT. Produce bullet point quando avevo chiesto prosa. Ogni fallimento si traduce in una regola aggiuntiva nel system prompt, scritta in negativo e con un controesempio dentro le istruzioni.
Questo è il punto in cui la maggior parte dei progetti si ferma. Sbagliato. Il system prompt iniziale è una bozza. La versione finale arriva dopo quattro-sei cicli di iterazione, mai al primo colpo. Chi promette Custom GPT funzionanti in un pomeriggio sta vendendo un demo, non un asset operativo.
Un’attenzione operativa che fa risparmiare tempo. Tenere un foglio Google con il set di quaranta prompt di controllo e una colonna per ogni iterazione del system prompt. Per ogni prompt si segna passa/non passa e una nota qualitativa. Dopo tre iterazioni si vede subito quali categorie di prompt sono ancora rotte e dove intervenire. Senza questo log, ogni iterazione sembra un miglioramento generico mentre in realtà sta rompendo casi che funzionavano prima.
Manutenzione, governance, errori da non ripetere
Un Custom GPT non è un asset statico. Va rivisto ogni trimestre. Il modello sotto cambia. Il brand evolve. I casi d’uso aumentano.
Errore frequente: dare accesso al GPT a tutto il team senza linee guida. Chiunque modifica il prompt, nessuno tiene traccia. Dopo due mesi è una versione degradata, imbottita di patch che si annullano a vicenda. Soluzione operativa: un owner, un repository versionato del system prompt su Notion o Git, un changelog scritto. Modifiche solo dall’owner, proposte dagli altri via documento.
Per chi gestisce questi flussi in azienda, vale la pena verificare anche il quadro normativo. Il Regolamento UE 2024/1689 (AI Act) impone obblighi di trasparenza sui sistemi che generano contenuti per il pubblico, e una credenziale europea sull’uso professionale dell’intelligenza artificiale è oggi uno dei pochi segnali rapidi per dimostrare competenza in fase di audit interno o lato cliente.
Un Custom GPT ben costruito non sostituisce il copy. Lo accelera. Quando lo costruisci bene, il copywriter passa dal settanta per cento di tempo speso a scrivere prime bozze al settanta per cento di tempo a fare editing e direzione creativa. È questo lo spostamento che conta, non l’output automatico. E si vede sulla qualità finale dei testi, non sul tempo di consegna.
