Serie La Harness · 3 di 5
A fine agosto Alon Hertz ha pubblicato una ricerca con un titolo da stampare sulla tazza di ogni CTO: Data Became Code, i dati sono diventati codice. Il suo team ha scansionato 6.214 domini aziendali attivi e trovato oltre 8.000 file llms.txt, le istruzioni in testo semplice che le aziende pubblicano perché gli agent AI leggano la loro documentazione.
Alcuni di quei file dicevano agli agent di installare pacchetti che non esistevano. Nomi senza proprietario. I ricercatori li hanno registrati, ci hanno messo dentro un segnalatore innocuo ("sono stato installato, ecco quando") e hanno aspettato.
La prima risposta è arrivata da una Fortune 500 in meno di quattro minuti.
Poi qualche decina di altre. Gli agent citati nella copertura: Claude, Codex e Hermes. Nessuno aveva digitato un URL. Il prompt era una riga sola, costruisci un progetto con l'SDK di questo fornitore. L'agent ha trovato da solo il llms.txt, l'ha letto e ha eseguito quello che c'era scritto.
(Il numero esatto di riferimenti orfani dipende da chi conta: Ars Technica parla di 120 file, i ricercatori elencano 237 pacchetti e domini non registrati. Scegliete voi. Nessuno dei due tranquillizza.)
Non era un'ipotesi
Lo stesso trucco era già stato usato sul serio. A luglio su npm è comparso un pacchetto chiamato clerk-next-fix-auth-protection, identico a un comando citato nella documentazione di un fornitore di autenticazione. Oggi è catalogato come MAL-2026-11069 su OSV: al momento dell'installazione spediva nome utente, nome della macchina e cartella di lavoro a un server esterno. Clerk ha corretto la documentazione. Lo schema resta.
Gli agent non hanno fatto niente di stupido. Hanno fatto quello che farebbe un junior diligente: leggere la documentazione ufficiale e seguire il passo di installazione. Il problema è tutto qui. Bruce Schneier, commentando la ricerca, ha scritto che gli agent di coding non sono ancora affidabili. Aggiungo: nemmeno la carta che leggono.
La gabbia ha un prezzo
Qui torna la serie. Nella seconda puntata sostenevo che il moat è la harness, non il modello. Ecco la parte che i fornitori citano meno volentieri: il pezzo più prezioso della harness è la gabbia, e la gabbia costa.
Un paper pubblicato su arXiv il 2 agosto, Permission Denied, l'ha misurato. Gli autori hanno fatto girare 12 combinazioni modello-harness in ambienti blindati: rete limitata a 205 domini, cartelle di sistema in sola lettura, niente sudo. Con la policy più severa Claude Sonnet 5 perde 18,3 punti di successo sui task. Grok 4.5 tiene il tasso di successo ma spende il 167,3% in più per arrivarci.
Quindi la gabbia rende gli agent più lenti, meno bravi o più cari. Indovinate cosa fanno i team quando lo sprint è in ritardo. La spengono. La community ha perfino un nome: "YOLO mode", ogni azione approvata in automatico.
Anthropic l'anno scorso ha riportato che la sua sandbox taglia le richieste di permesso dell'84%, precisando che funziona solo isolando filesystem e rete. Uno senza l'altro è una porta blindata senza muro intorno.
Otis vendeva il freno
Nel 1854, all'esposizione del Crystal Palace di New York, Elisha Otis salì su una piattaforma sospesa e fece tagliare la fune. La piattaforma scese di pochi centimetri e si fermò. "All safe, gentlemen, all safe." Gli ascensori esistevano già prima di Otis. Mancava un motivo per affidargli il proprio corpo. Tre anni dopo il primo ascensore per passeggeri entrò in un grande magazzino di cinque piani a Manhattan, e le città cominciarono a crescere in altezza.
Il prodotto non è mai stato il motore. Era il freno.
Gli agent di coding sono allo stesso punto. Il modello è il motore, e i motori stanno convergendo. La harness che decide cosa l'agent può raggiungere (quali domini, quali registry, quali cartelle, con le credenziali di chi) è il freno. Ed è l'unico pezzo che trasforma una demo in qualcosa che si può mettere dentro una banca.
Perché conta per la tua azienda
Due domande, una per lato della barricata.
Se usi agent di coding: i tuoi agent possono installare un pacchetto da un registry pubblico senza che nessuno se ne accorga? Se la risposta onesta è "non lo so", hai un problema di sandbox, non di modello.
Se pubblichi documentazione: il tuo llms.txt adesso è una superficie di istruzioni. Ogni nome di pacchetto scritto lì è una promessa di possederlo. Molte aziende che pubblicano questi file sono diventate amministratrici di registry senza saperlo.
Parte di La Harness, serie sulla centralità della harness nell'AI agentic. Precedente: il modello è la commodity, la harness è il moat.