Come sono stati ricavati questi dati, e cosa non sono

Data l'enorme mole di documenti, oltre 4mila, si e' usata una combinazione di espressioni regex, Retrieval-Augmented Generation, analisi semantica e modelli linguistici open source per estrarre i dati significativi. Visto che, come sappiamo, gli LLM sono strumenti per loro natura non intelligenti ne' affidabili, ne in grado di capire il contesto, i dati qui presenti sono da intendersi come non verificati: invitiamo a non usarli come fonte, ma come punto di partenza per la ricerca di informazioni.

Speriamo che questo sia utile a collettivi, giornalist*, ricercator* e amministrazioni per avere un archivio e una panoramica dei data center in costruzione, nonche' per costruire un archivio storico e semplificare l'accesso ai documenti.

PS: Anche comprimendo e usando tecniche di vettorializzazione, per analizzare le quasi 95.125 pagine di documenti sono stati necessari 9 milioni di tokens. Forse dovremmo interrompere il loop per cui siamo costretti a usare LLM per navigare l'enorme mole di documenti generati da chatbot.

Potenza installata 10 – 100 MW 100 – 500 MW 500 MW – 1 GW 1 GW e oltre non dichiarata