Il progetto ha valutato oltre 50 modelli linguistici di grandi dimensioni (LLM), tra cui GPT, Gemma, Llama e Mistral, e fornisce un quadro comparativo basato su prestazioni, sicurezza, trasparenza e allineamento con i valori democratici. Gemma4 e GPT-40 sono attualmente in testa alla classifica, mentre Mistral Small 3.1 si colloca tra i primi dieci. L'iniziativa include dati provenienti direttamente dalle pratiche amministrative e valuta sette criteri fondamentali, tra cui l'accuratezza fattuale e l'adesione ai valori dell'UE.
Lettura del bias (Centro): L'articolo presenta una panoramica equilibrata delle sfide tecniche e normative che la pubblica amministrazione deve affrontare per l'adozione di modelli di IA. Non assume una chiara posizione ideologica, ma si concentra piuttosto sulle implicazioni pratiche e sui criteri di valutazione stabiliti dalla Bundesdruckerei.




