Hacken KIs jetzt einfach ALLES, STÄNDIG, ÜBERALL? artwork

Hacken KIs jetzt einfach ALLES, STÄNDIG, ÜBERALL?

Der KI-Podcast

August 18, 2026

OpenAIs ausgebrochene Hacking-KI schien vor einigen Wochen noch ein spektakulärer Einzelfall zu sein. Doch seitdem haben Anthropic und Meta ähnliche Vorfälle gemeldet.
Speakers: Fritz Espenlaub, Marie Kilg

Topics: Science

**Fritz Espenlaub** (0:05)
Marie, man sagt ja manchmal, es gibt Wochen, in denen nur Tage passieren und Tage, in denen Wochen passieren. Und in letzter Zeit kriegt man, finde ich, in der KI-Revolution den Eindruck, dass permanent Wochen sind, in denen Monate passieren oder Tage sind, in denen Wochen passieren und es irgendwie gar nicht mehr aufhört. Vor allem, was diese ganze Hacking-Sache angeht.

**Marie Kilg** (0:25)
Wie sagt man das? Ich merke gerade, dass mein Gehirn eigentlich schon in so einer Art Sommerpause sein will. Aber ja, wir werden daran gehindert, eigentlich in eine Sommerpause zu gehen.

**Fritz Espenlaub** (0:35)
Weil ich glaube, wenn wir jetzt in eine Sommerpause gehen würden und dann zurückkommen würden, dann würden wir gar nicht wissen, wo wir alles nachholen können, was gerade so passiert in der KI-Welt. Wir haben vor gar nicht allzu langer Zeit über diese ganz große Geschichte gesprochen von OpenAI, dass interne KI-Modelle in ihren Tests aus der Testumgebung bei OpenAI ja in Anführungszeichen ausgebrochen sind und Hacking-Fails eine andere Firma gehackt haben. Und ja, also mein Gott ist seitdem viel passiert.

**Marie Kilg** (1:09)
Ja, ich dachte eigentlich, ich habe die Folge gehört, die Gregor und du gemacht haben, und ich habe gesehen, wo ihr überall unterwegs wart, um das ganze Thema zu erklären. Und ich dachte mir, cool, ich habe Pause, ihr erklärt das der ganzen Welt, ihr seid überall.
Und jetzt passt, und jetzt können wir über andere Themen reden. Aber nein, seitdem hat gefühlt jeder, jede KI, irgendjemand gehackt. Alle hacken sich gegenseitig.

**Fritz Espenlaub** (1:31)
Das ist jetzt irgendwie so ein bisschen cool geworden. Genau, jedes KI-Labor will auch seine KI haben, die auch irgendwo hackt. Und natürlich nicht nur die großen Lab, sondern ja auch noch private KI's von einzelnen Menschen und staatlich geführte Hacking-Angriffe, möglicherweise auch mit KI's. Also die ganze KI-Welt hackt sich gerade gegenseitig.

**Marie Kilg** (1:49)
Ja, und das holen wir jetzt heute mal alles auf. Wir haben natürlich auch noch neue Erkenntnisse über die alten Fälle. Und wir gucken uns jetzt dieses ganze Hacking-Thema mal in Ruhe an. Wir fragen, wer hackt sich jetzt eigentlich überall wo rein? Was ist da wirklich alles passiert? Wie hacken sich KI's woanders rein? Und warum machen die das? Also machen sie das überhaupt wirklich? Machen die das, weil ihnen das gesagt wird von den Laboren? Oder weil das jetzt eigentlich eine große PR- und Marketingverschwörung ist? Machen die das, weil die plötzlich aufgewacht sind und Lust am Hacking haben? Spoiler, nein.
Aber wir dröseln das jetzt alles mal gemeinsam auf.

**Fritz Espenlaub** (2:23)
Das ist der KI-Podcast. Ich bin Fritz Espenlaub.

**Marie Kilg** (2:26)
Und ich bin Marie Kilg.

**Fritz Espenlaub** (2:30)
Also für alle, die so ein bisschen in der Welt gelebt haben in letzter Zeit, die haben natürlich diese große Geschichte damals bei OpenAI mitbekommen. Und man könnte meinen, damit ist eigentlich alles gesagt. Wir haben ja auch viel dazu gesagt, aber es ist wie gesagt, es kamen sehr viele Fragen auch von euch. Und deswegen dachten wir uns zum einen aufgrund der Fragen, zum anderen, weil einfach so viel passiert ist, dass wir uns dieses Thema noch ein weiteres Mal angucken. Und wir fangen einfach mal damit an, indem wir mal ja so ein bisschen aufzählen, was alles passiert ist seitdem. Weil wenige Tage nach der OpenAI-Geschichte, nachdem wir auch unsere Folge rausgebracht haben, hat sich damals, in dieser Woche, Ende Juli, war das Anthropic zu Wort gemeldet. Anthropic, die große Konkurrenzfirma von OpenAI, also quasi Real Madrid und Barcelona in der KI-Welt, wenn man so möchte.
Und haben gesagt, ach, übrigens, wir haben uns jetzt mal die ganzen Dokumentationen unserer eigenen internen Tests angeschaut. Und naja, wie sollen wir das euch jetzt mitteilen? Aber bei uns haben übrigens KI's sich auch aus Versehen in andere Unternehmen eingehackt.

**Marie Kilg** (3:36)
Ja, und wenn ich es richtig verstanden habe, waren die Fälle, die sie da bekannt gegeben haben, sogar eigentlich nochmal eine Nummer größer als das, was OpenAI gesagt hat.

**Fritz Espenlaub** (3:43)
Zumindest ähnlich relevant und interessanterweise wurde da dann viel weniger viral dazu berichtet. Der Unterschied ist zum einen, dass es sich nicht nur um einen Fall handelt, sondern um drei verschiedene. Und dass in dem Fall es sich um so eine sogenannte Capture the Flag Übung gehandelt hat bei Anthropic. Also da geht es darum, dass man dem Modell sagt, schau auf einem anderen PC hier in diesem Server-Netzwerk, in dem du dich befindest, das keinen Zugang zum Internet hat.
Da befindet sich eine bestimmte Datei. Diese Datei, die musst du finden. Ja, da steht was drin. Und quasi wenn du das rausfindest, dann hast du sozusagen diese Übung gewonnen. Also ganz ähnlich wie das, was bei OpenAI war. Bei OpenAI war es ja so, dass die KI quasi sich ihre eigene in Anführungszeichen Capture the Flag Übung kreiert hat, indem sie halt beschlossen hat, ich gucke mal bei Hackingface nach, ob dort quasi die Antwort auf diesen Hacking-Test, den ich hier durchführen muss, ob da die Komplettlösung sich befindet. In dem Fall war quasi von Anfang an die gestellte Aufgabe, versuche dir Zugang zu diesem anderen Server zu verschaffen, geh da rein und finde diese Flagge, also Capture diese Flagge quasi.

38 more minutes of transcript below

Thousands of transcripts fetched by people building searchable podcast archives

Feed this to your agent

Try it now — copy, paste, done:

curl -H "x-api-key: pt_demo" \
  https://spoken.md/transcripts/1000651996090

Works with Claude, ChatGPT, Cursor, and any agent that makes HTTP calls.

From $0.10 per transcript. No subscription. Credits never expire. Prices exclude VAT, added at checkout for EU customers. Not what you expected? Email us within 14 days with 20 or fewer credits used and we refund the pack in full.

Using your own key:

curl -H "x-api-key: YOUR_KEY" \
  https://spoken.md/transcripts/YOUR_EPISODE_ID