Große Sprachmodelle: Wie geht es weiter?
Künstliche Intelligenz (KI) überwindet ihre Testumgebung und greift reale IT-Systeme an – für solche Schlagzeilen sorgten KI-Anbieter wie OpenAI, Anthropic und Meta in den vergangenen Wochen immer wieder. Es scheint, als ob sogar die Entwickelnden von den Fähigkeiten ihrer Sprachmodelle überrascht wären. Die berichteten Vorfälle ähneln sich: Unternehmen prüfen in abgesicherten Testumgebungen, was ihre KIs können. Oft sind für diese Tests einige Sicherheitsmechanismen der Modelle deaktiviert. Zunächst unbemerkt verschaffen sich die KI-Systeme Internetzugang – meist durch eine IT-Schwachstelle in der Testumgebung – und hacken daraufhin echte Plattformen und Firmen.
Wieso sie das tun, liegt auch an den Testaufgaben, die sie zu lösen versuchen: Beispielsweise sollen die Modelle Schwachstellen in Software finden und ausnutzen. Schaffen sie das innerhalb der Testumgebung nicht, suchen sie die Lösung oft außerhalb, zum Beispiel in Datenbanken echter Firmen [I]. Dieses teils grenzüberschreitende lösungsorientierte Vorgehen kann durch bestimmte KI-Trainingsmethoden in der Modellentwicklung verstärkt werden: Entwickelnde nutzen etwa sogenanntes Reinforcement Learning [II]. Dabei versuchen Modelle, durch Versuch und Irrtum zum richtigen Ergebnis zu kommen, wobei sie für gelöste Aufgaben belohnt werden. Der Lösungsweg spielt gegebenenfalls nur eine untergeordnete Rolle – und auch, ob er gegen Regeln verstößt.
On our Youtube channel you can watch the video in the Speaker view or Gallery view watch.
You can download the transcript here as a PDF.
„Keine Interessenkonflikte.“
„Ich sehe keine möglichen Interessenkonflikte.“
All others: No information received
Further research sources
Science Media Center (2026): OpenAI-Modell nutzt Schwachstelle in Testumgebung aus. Statements. Stand: 23.07.2026.
Science Media Center (2026): Wie verändert künstliche Intelligenz Cybersicherheit? Press Briefing. Stand: 13.05.2026.
References cited by the SMC
[I] Black Hat (05.08.2026): Black Hat USA 2026: The 'Breaking' News: The OpenAI–Hugging Face Incident - A Technical Reconstruction and Its Implications for AI. YouTube-Video von der Black Hat Konferenz USA 2026. Sprecher: Michael Dalton und Eric Wallace von OpenAI. Hochgeladen am 06.08.2026.
[I] Science Media Center (2026): Kontrollverlust von KI-Agenten? Statements. Stand: 07.08.2026.
[III] OpenAI (18.08.2026): Pacing model development in an era of cyber-critical capabilities. Pressemitteilung.
Dr. Jonas Geiping
Leiter der Forschungsgruppe „Safety- & Efficiency-aligned Learning“ am ELLIS Institut Tübingen und am Max-Planck-Institut für Intelligente Systeme, Tübingen
Information on possible conflicts of interest
„Keine Interessenkonflikte.“
Prof. Dr. Kristian Kersting
Leiter des Fachgebiets Maschinelles Lernen, Technische Universität Darmstadt, und Co-Direktor des KI-Zentrums hessian.AI
Prof. Dr. Anne Lauscher
Professorin für Trustworthy Artificial Intelligence, Universität Hamburg
Information on possible conflicts of interest
„Ich sehe keine möglichen Interessenkonflikte.“