Große Sprachmodelle: Wie geht es weiter?
Künstliche Intelligenz (KI) überwindet ihre Testumgebung und greift reale IT-Systeme an – für solche Schlagzeilen sorgten KI-Anbieter wie OpenAI, Anthropic und Meta in den vergangenen Wochen immer wieder. Es scheint, als ob sogar die Entwickelnden von den Fähigkeiten ihrer Sprachmodelle überrascht wären. Die berichteten Vorfälle ähneln sich: Unternehmen prüfen in abgesicherten Testumgebungen, was ihre KIs können. Oft sind für diese Tests einige Sicherheitsmechanismen der Modelle deaktiviert. Zunächst unbemerkt verschaffen sich die KI-Systeme Internetzugang – meist durch eine IT-Schwachstelle in der Testumgebung – und hacken daraufhin echte Plattformen und Firmen.
Wieso sie das tun, liegt auch an den Testaufgaben, die sie zu lösen versuchen: Beispielsweise sollen die Modelle Schwachstellen in Software finden und ausnutzen. Schaffen sie das innerhalb der Testumgebung nicht, suchen sie die Lösung oft außerhalb, zum Beispiel in Datenbanken echter Firmen [I]. Dieses teils grenzüberschreitende lösungsorientierte Vorgehen kann durch bestimmte KI-Trainingsmethoden in der Modellentwicklung verstärkt werden: Entwickelnde nutzen etwa sogenanntes Reinforcement Learning [II]. Dabei versuchen Modelle, durch Versuch und Irrtum zum richtigen Ergebnis zu kommen, wobei sie für gelöste Aufgaben belohnt werden. Der Lösungsweg spielt gegebenenfalls nur eine untergeordnete Rolle – und auch, ob er gegen Regeln verstößt.
Auf unserem Youtube-Kanal können Sie das Video in der Sprecheransicht oder Galerieansicht anschauen.
Das Transkript können Sie hier als PDF herunterladen.
„Keine Interessenkonflikte.“
„Ich sehe keine möglichen Interessenkonflikte.“
Alle anderen: Keine Angaben erhalten
Weiterführende Recherchequellen
Science Media Center (2026): OpenAI-Modell nutzt Schwachstelle in Testumgebung aus. Statements. Stand: 23.07.2026.
Science Media Center (2026): Wie verändert künstliche Intelligenz Cybersicherheit? Press Briefing. Stand: 13.05.2026.
Literaturstellen, die vom SMC zitiert wurden
[I] Black Hat (05.08.2026): Black Hat USA 2026: The 'Breaking' News: The OpenAI–Hugging Face Incident - A Technical Reconstruction and Its Implications for AI. YouTube-Video von der Black Hat Konferenz USA 2026. Sprecher: Michael Dalton und Eric Wallace von OpenAI. Hochgeladen am 06.08.2026.
[I] Science Media Center (2026): Kontrollverlust von KI-Agenten? Statements. Stand: 07.08.2026.
[III] OpenAI (18.08.2026): Pacing model development in an era of cyber-critical capabilities. Pressemitteilung.
Dr. Jonas Geiping
Leiter der Forschungsgruppe „Safety- & Efficiency-aligned Learning“ am ELLIS Institut Tübingen und am Max-Planck-Institut für Intelligente Systeme, Tübingen
Angaben zu möglichen Interessenkonflikten
„Keine Interessenkonflikte.“
Prof. Dr. Kristian Kersting
Leiter des Fachgebiets Maschinelles Lernen, Technische Universität Darmstadt
Prof. Dr. Anne Lauscher
Professorin für Trustworthy Artificial Intelligence, Universität Hamburg
Angaben zu möglichen Interessenkonflikten
„Ich sehe keine möglichen Interessenkonflikte.“