Der Artikel behandelt die Initiative der Bundesdruckerei mit dem Namen "Möve", die darauf abzielt, KI-Sprachmodelle zu bewerten, die speziell auf die Verwendung durch deutsche Behörden zugeschnitten sind. Sie hebt die Grenzen internationaler Rankings hervor, die sich in erster Linie auf Englischverständnis und mathematische Fähigkeiten konzentrieren, und betont die Notwendigkeit von Modellen, die die deutsche Sprache, Rechtssicherheit, Sicherheit und Nachhaltigkeit genau handhaben. Das Projekt hat über 50 große Sprachmodelle (LLMs), einschließlich GPT, Gemma, Llama und Mistral, ausgewertet und bietet einen vergleichenden Rahmen, der auf Leistung, Sicherheit, Transparenz und Übereinstimmung mit demokratischen Werten basiert. Gemma4 und GPT-40 führen derzeit die Rangliste an, während Mistral Small 3.1 sich in den Top Ten befindet. Die Testinitiative enthält Daten, die direkt aus administrativen Praktiken stammen, und bewertet sieben Kernkriterien, darunter Sachgenauigkeit und Einhaltung der EU-Werte.
Tendenz-Einschätzung (Mitte): Der Artikel bietet einen ausgewogenen Überblick über die technischen und regulatorischen Herausforderungen, mit denen die öffentliche Verwaltung bei der Einführung von KI-Modellen konfrontiert ist.




