El artículo analiza la iniciativa de la Bundesdruckerei llamada "Möve", que tiene como objetivo evaluar modelos de lenguaje de IA específicamente diseñados para su uso por las autoridades públicas alemanas. Destaca las limitaciones de las clasificaciones internacionales que se centran principalmente en la comprensión del inglés y las habilidades matemáticas, enfatizando la necesidad de modelos que manejen con precisión el idioma alemán, la confiabilidad legal, la seguridad y la sostenibilidad. El proyecto ha evaluado más de 50 modelos de lenguaje grandes (LLM), incluidos GPT, Gemma, Llama y Mistral, y proporciona un marco comparativo basado en el rendimiento, la seguridad, la transparencia y la alineación con los valores democráticos. Gemma4 y GPT-40 lideran actualmente la clasificación, mientras que Mistral Small 3.1 se ubica entre los diez primeros. La iniciativa de prueba incluye datos obtenidos directamente de prácticas administrativas y evalúa siete criterios básicos, incluida la precisión fáctica y la adhesión a los valores de la UE.
Lectura del sesgo (Centro): El artículo presenta una visión general equilibrada de los desafíos técnicos y normativos que enfrenta la administración pública en la adopción de modelos de IA. No adopta una postura ideológica clara, sino que se centra en las implicaciones prácticas y los criterios de evaluación establecidos por la Bundesdruckerei.




