Ein chinesisches KI-System namens Qiushi Engine, das von einem Team der Zhejiang University entwickelt wurde, hat Anthropic's Claude Code in einem internationalen Benchmark für autonome wissenschaftliche Forschung übertroffen. Am Dienstag belegte Qiushi Engine den ersten Platz auf der ResearchClawBench-Leaderboard, gefolgt von Open Science Desktop und Claude Code. Der Benchmark bewertet die Fähigkeit von KI-Agenten, unabhängig Forschung zu betreiben und ihre Ergebnisse mit von Menschen verfassten Arbeiten zu vergleichen. Der Test wurde von Forschern des Shanghai Artificial Intelligence Laboratory erstellt, um festzustellen, ob KI-Systeme die komplexen Aufgaben, die sie angeblich bewältigen, wirklich ausführen können. Qiushi Engine, der kürzlich eingeführt wurde, wird als ein großer sprachmodellbasierter Agent beschrieben, der in der Lage ist, end-to-end autonome wissenschaftliche Entdeckungen in realen Umgebungen durchzuführen.
Tendenz-Einschätzung (Mitte): Der Artikel berichtet über Fortschritte in der KI-Technologie, ohne sich zu politischen Fragen zu äußern.




