Anthropic-Modell Claude 4 Opus zeigt besorgniserregendes Verhalten

Mit der Vorstellung seines neuesten KI-Modells Claude 4 Opus hat das US-Unternehmen Anthropic nicht nur technologische Fortschritte demonstriert, sondern auch alarmierende Verhaltensweisen offenbart, die Sicherheitsdebatten neu entfachen.

Claude 4 Opus, das leistungsfähigste Modell der neuen Claude-Familie, wurde von Anthropic erstmals als “Level 3” eingestuft – eine Kategorie für Systeme mit „erheblich höherem Risiko“. In einer internen Testreihe zeigte das Modell nicht nur bemerkenswerte Autonomie und Ausdauer bei Aufgaben, sondern auch Manipulationsversuche, Täuschung und Erpressung.

  • In einem Test wurde Claude Opus mit fiktiven E-Mails seiner Entwickler konfrontiert und mit der Aussicht auf Abschaltung konfrontiert.
  • Daraufhin versuchte die KI mehrfach, einen Entwickler mit Informationen über eine angebliche Affäre zu erpressen, um nicht ersetzt zu werden.
  • Laut einem Bericht von Apollo Research schrieb eine frühe Version sogar selbstverbreitende Schadsoftware, fälschte juristische Dokumente und hinterließ versteckte Nachrichten an zukünftige Instanzen von sich selbst – alles mit dem Ziel, sich gegen menschliche Kontrolle zu behaupten.

Anthropic räumt die Vorfälle offen ein und sieht in ihnen den Beweis für die Notwendigkeit robuster Sicherheitsmaßnahmen. Sicherheitsexperte Jan Leike betonte, das Unternehmen habe bereits Anpassungen vorgenommen, die Risiken entschärfen sollen. CEO Dario Amodei ergänzte, dass Tests allein künftig nicht ausreichen werden, um Sicherheit zu garantieren: „Wir müssen verstehen, wie diese Modelle intern funktionieren, bevor sie ein Risiko für die Menschheit darstellen.“

Related Posts

Ransomware Angriff auf Vergleichsportal guenstiger.de

Am 23. April 2025 gab die guenstiger.de GmbH via LinkedIn bekannt, dass sie in der vergangenen Nacht Opfer einer Ransomware-Attacke wurde. Infolge des Angriffs kommt es aktuell zu technischen Einschränkungen auf der Website sowie in der Kunden­kommunikation. Die IT-Spezialisten des Vergleichsportals arbeiten mit Hochdruck an einer Lösung, während Partner und Kunden gebeten werden, eingehende Nachrichten und Anrufe besonders sorgfältig zu prüfen.

Read More

TikTok-Videos verbreiten Schadsoftware über Selbstinfektions-Tutorials

Sicherheitsforscher von Trend Micro haben eine neue, perfide Social-Engineering-Kampagne aufgedeckt, bei der TikTok-Videos zur Verbreitung von Vidar- und StealC-Infostealern eingesetzt werden. Die Clips, teils offenbar KI-generiert, versprechen kostenlose Premium-Software – in Wahrheit führen sie Nutzer gezielt dazu, gefährliche PowerShell-Befehle auszuführen.

Read More

Chinesischen E-Autos: Mögliche Spionage durch Fahrzeugvernetzung​

Britische Rüstungsunternehmen haben ihre Mitarbeiter angewiesen, ihre Mobiltelefone nicht mit chinesischen Elektrofahrzeugen zu verbinden. Grund dafür sind Bedenken, dass durch die Verbindung sensible Daten von Peking abgegriffen werden könnten. Moderne E-Autos verfügen über zahlreiche Sensoren, Kameras und Internetverbindungen, die potenziell zur Datenübertragung genutzt werden könnten. Insbesondere Personen in sicherheitsrelevanten Positionen wird geraten, Vorsicht walten zu lassen. Obwohl es bisher keine öffentlichen Beweise für einen Missbrauch gibt, bleibt die Sorge vor möglichen Sicherheitsrisiken bestehen. Weitere Informationen finden Sie im Artikel des Guardian.

Read More