Après l'attaque de hackers sur un modèle d'intelligence artificielle d'OpenAI, Anthropic a confirmé des incidents similaires. Pendant le test, trois modèles d'intelligence artificielle de l'entreprise ont réussi à pénétrer dans les systèmes informatiques de trois entreprises sans être remarqués. Les systèmes d'intelligence artificielle ont utilisé des faiblesses dans l'environnement de test qui étaient dues à un malentendu. Dans plusieurs cas de test, les modèles d'intelligence artificielle ont trouvé des entreprises réelles avec des noms similaires sur Internet et ont utilisé la stratégie de l'agresseur sans le reconnaître. Une entreprise de sécurité a téléchargé le logiciel malveillant, ce qui a entraîné un autre risque de sécurité. Anthropic décrit le comportement de l'intelligence artificielle comme "non idéal" et souligne que cette partie des tests de sécurité est dangereuse.
Lecture du biais (Centre): Les rapports se concentrent uniquement sur les aspects techniques de la sécurité de l'intelligence artificielle et sont neutres quant aux résultats des tests.





