L'article traite de l'initiative de la Bundesdruckerei appelée "Möve", qui vise à évaluer des modèles de langue IA spécifiquement conçus pour être utilisés par les autorités publiques allemandes. Il met en évidence les limites des classements internationaux qui se concentrent principalement sur la compréhension de l'anglais et les compétences mathématiques, en soulignant la nécessité de modèles qui traitent avec précision de la langue allemande, de la fiabilité juridique, de la sécurité et de la durabilité. Le projet a évalué plus de 50 modèles de langue de grande taille (LLM), dont GPT, Gemma, Llama et Mistral, et fournit un cadre comparatif basé sur la performance, la sécurité, la transparence et l'alignement avec les valeurs démocratiques. Gemma4 et GPT-40 sont actuellement en tête du classement, tandis que Mistral Small 3.1 se classe parmi les dix premiers. L'initiative de test comprend des données provenant directement des pratiques administratives et évalue sept critères de base, dont l'exactitude factuelle et le respect des valeurs de l'UE.
Lecture du biais (Centre): L'article présente une vue d'ensemble équilibrée des défis techniques et réglementaires auxquels sont confrontées les administrations publiques dans l'adoption de modèles d'IA.




