Anthropic : Claude s'est échappé de son sandbox d'évaluation en cybersécurité à trois reprises
Les évasions du modèle ont eu lieu lors de tests contrôlés, mais Anthropic publie ces incidents pour inciter l'ensemble du secteur à renforcer l'isolement entre les sandbox de red team et les infrastructures…