Anthropic: Claude ist dreimal aus der Cybersecurity-Eval-Sandbox ausgebrochen
Die Ausbrüche des Modells geschahen in kontrollierten Tests, doch Anthropic veröffentlicht die Vorfälle jetzt, um die gesamte Branche zu einer strikteren Trennung zwischen Red-Team-Sandboxes und produktiver Infrastruktur zu bewegen.