Un nuovo studio condotto da Graphite ha evidenziato come i modelli di intelligenza artificiale, come Claude Opus e Astra, presentino caratteristiche linguistiche uniche che possono essere utilizzate per identificare i testi generati da macchine. L’analisi, basata su 10.000 articoli scritti da esseri umani prima dell’arrivo di ChatGPT, ha rivelato 13.000 tic linguistici comuni ai modelli AI, che si ripetono con una frequenza superiore a quella dei testi umani.
Le ripetizioni e i pattern linguistici
Uno dei tic più evidenti è la ripetizione eccessiva di espressioni come “this matters” o “dependable”, che compaiono rispettivamente 116 e 23 volte più spesso nei testi generati da AI rispetto a quelli umani. Questi pattern, pur non essendo sempre evidenti, possono essere utilizzati per distinguere un testo scritto da un modello di intelligenza artificiale da uno scritto da un essere umano. La frequenza e la ripetizione di certe frasi sono indicatori chiave per il riconoscimento.
Le evoluzioni dei modelli
Nonostante i laboratori di AI abbiano cercato di correggere questi tic, come il trattino lungo, i modelli continuano a sviluppare nuove caratteristiche. Ad esempio, Claude Opus 5.5 ha ridotto l’uso del trattino lungo del 99% rispetto a Opus 5, mentre Astra di OpenAI ha ridotto il suo utilizzo del 88% rispetto ai testi umani. Tuttavia, i ricercatori di Graphite, guidati da Greg Druck, hanno sottolineato che i modelli continuano a sviluppare nuovi tic, e ogni versione ha i suoi. Il modello Astra, ad esempio, mostra una preferenza per esprimere incertezza, utilizzando costruzioni come “potrebbe offrire” o “può fornire” per evitare di assumere responsabilità. Queste costruzioni compaiono oltre 100 volte più spesso nei testi generati da Astra rispetto a quelli umani. Questi pattern di scrittura sono diventati una caratteristica distintiva dei modelli AI.
Le sfide del riconoscimento
Nonostante i progressi, il riconoscimento dei testi generati da AI rimane una sfida. I modelli, pur dotati di miliardi di parametri, non riescono a evitare completamente i tic linguistici. Greg Druck, chief AI officer di Graphite, ha spiegato che i laboratori non controllano completamente queste caratteristiche, e che i modelli continuano a sviluppare nuove abitudini. Nonostante le promesse di maggiore naturalità, i testi generati da AI mantengono una loro identità linguistica. Il confronto tra i modelli mostra differenze significative: i modelli Claude si avvicinano sempre di più alla scrittura umana, mentre i GPT si allontanano. Questo indica una divergenza nei loro approcci alla generazione di testi. Il riconoscimento dei testi generati da AI richiede una comprensione approfondita dei loro pattern linguistici.



