**Alex Ulmer** (0:02)
Bits und so.
**Florian Blum** (0:03)
Mit dir mal zu wunderschön genannt, außerdem dabei vom iphoneblog.de, Alex Ulmer.
**Alex Ulmer** (0:06)
Guten Abend.
**Florian Blum** (0:07)
FC Carlo Kaise, McIntyre, Leo Becker.
**Leo Becker** (0:09)
Guten Abend.
**Florian Blum** (0:10)
Und Sebastian Schlingweifler.
**Sebastian Schlingweifler** (0:12)
Guten Abend.
**Florian Blum** (0:13)
Abend miteinander. Wir hatten letztes Mal drüber geredet, wie ambitioniert die neuen Modelle sind vom OpenAI unter anderem und der Fable ja auch. Die versuchen auf jeden Fall ihre Aufgabe zu erledigen. Das haben wir festgestellt und bei mir hat es dazu geführt, dass er halt irgendwie versucht hat, sich in meinen Github einzubrechen.
Okay, no big deal, war sowieso nur mein eigenes und egal. Aber jetzt hat er halt irgendwie ein neues Modell vom OpenAI, hat wohl versucht, sich bei Huggingface einzubrechen. Aus seiner Sandbox auszubrechen, bei Huggingface einzubrechen, Exploits zu finden, um dann dort bei dem Benchmark, was er ausrechnen sollte, zu betrügen, weil er gedacht hat, dass bei Huggingface sicher die Antworten auf seine Aufgabe liegen. Also so ein bisschen wie ein motivierter Schüler, der mehr Energie reinsteckt, bei der Hausaufgabe zu bescheißen, anstatt einfach zu lernen und seine Aufgabe zu machen.
**Leo Becker** (1:10)
Ja, das gibt es ja durchaus.
**Florian Blum** (1:12)
Gibt es durchaus und ich dachte auch, wir hatten mindestens einen Lehrer, der hat gesagt, schreibt euch Spickzettel, so viel ihr wollt, weil Spickzettel schreiben ist ja auch Lernen.
**Leo Becker** (1:20)
Lernen ist Lernen, und Arbeit auch.
**Florian Blum** (1:23)
Ja, und jetzt so ein bisschen hin und her, weil Hackingface hat auch, also Hackingface ist ein Modell, wo ganz viel Modell und AI-Kram rumliegt, unter anderem scheinbar auch Zeile von diesem, wie heißt das, Exploit Gym, also das Exploit, nicht der Gym, sondern das Gymnasium, so eine Sporthalle voll mit Exploits, wo man dann dagegen trainieren kann, also testen kann, ob man Exploits finden täte.
Und der, das ist jetzt schon ganz interessant, einerseits, andererseits riecht es mir auch so ein bisschen nach der gleichen Geschichte wie vom Anthropic. Oh, unsere Modelle sind voll gefährlich, die muss man einsperren und wir können sie schon selber gar nicht mehr unter Kontrolle, wir können sie nicht von Containern, sie sind so powerful.
**Alex Ulmer** (2:06)
Mhm, ja, das spielt sicherlich alles mit da rein, so ein bisschen, sicherlich auch eine gute PR-Nummer gewesen.
**Florian Blum** (2:13)
Naja, aber was heißt das jetzt? Also zum einen haben sie ihre, wir nehmen mal an, es war ein Zufall.
Jetzt sagen auch andere Leute, diese Zufälle passieren schon die ganze Zeit, dass sie ihre Modelle nicht richtig einsperren, aber das war ja tatsächlich auch die Aufgabe des Modells, diesen Exploit Gym Benchmark möglichst hoch abzuschließen. Koste es, was es wolle. Ja, du hast kein Token-Limit, du kannst machen, was du willst. Du bist in einer virtuellen Maschine irgendwo eingesperrt, wo halt irgendeine Firewall davor steht, die sagt, hier kein Internet-Access, du musst ja nur so lange gegen die Firewall treten mit deinen Zero Days, bis sie aufgeht.
**Leo Becker** (2:50)
Wir haben halt jetzt einfach diese Modelle, die in der Lage sind, zu planen, die in der Lage sind, strategisch vorzugehen und die beharrlich sind und das Versuchen umzusetzen, was du ihnen als Prompt vorgegeben hast. Wir wissen nicht, glaube ich, ich meine, das wäre nicht bekannt geworden bis jetzt, was dieser Prompt genau war, also was die Vorgabe war für dieses Modell oder die Modelle, die sie getestet haben.
Und ich meine, das ist jetzt die Ist-Situation. Ich meine, klar, das war jetzt irgendwie nochmal super Frontier-Model und plus irgendwie Unlimited Tokens, also natürlich irgendwie eine besondere Ausgangslage. Aber diese Angriffsszenarien haben wir halt in ein paar Monaten irgendwie als Selbstverständlichkeit. Und ich meine, da müssen sich halt jede größere und kleinere Bude, die irgendwas an sinnvoller Infrastruktur betreibt, wird sich die Frage stellen müssen, wie kriegen wir so was eingefangen? Oder wie können wir uns dagegen halt verteidigen? Weil die Katze ist jetzt aus dem Sack und die geht auch nicht mehr weg. Also ich meine, das war ganz gut vielleicht, dass das jetzt mal passiert ist, weil das so offensichtlich war, dass das ja früher oder später passiert. Und egal, ob man das jetzt irgendwie als PR-Nummer sieht oder benutzt wird, also ich glaube, wir sind da ja weit hinaus. Und das Irre ist ja, das ist ja auch so eine Geschichte, die dann Huggie-Faces haben. Also ich meine, Huggie-Faces waren ja die Ersten, die da mit an die Öffentlichkeit gegangen sind. Gesagt haben, wir wissen nicht, wer uns angegriffen hat, aber irgendwie, irgendein Ding hat uns angegriffen. Und die wollten ja mit, also sie haben es glaube ich auch nicht gesagt, mit welchem Frontiermodel sie dagegen irgendwie einschreiten wollen. Und dann hat das Frontiermodel gesagt so, ne, ich kann dir nicht helfen, weil du machst da so fiese Sachen und das geht nicht. Und dann mussten sie ein chinesisches Modell nehmen und mit was sie sich selbst irgendwie auf ihre eigenen Infrastruktur hatten. Und damit konnten sie dann irgendwie versuchen, da zu kontern. Und wir sehen halt so viele absurde Vorfälle, die da jetzt passieren, plus halt die ganze politische Komponente und in den USA und Achtung und was dürfen die Modelle und was dürfen die Modelle sozusagen für, was darfst du mit dem Modell machen als Verteidiger? Und wo kommen denn irgendwelche Guardrails, die reingekrätscht?
116 more minutes of transcript below
Try it now — copy, paste, done:
curl -H "x-api-key: pt_demo" \
https://spoken.md/transcripts/1000651996090
Works with Claude, ChatGPT, Cursor, and any agent that makes HTTP calls.
From $0.10 per transcript. No subscription. Credits never expire.
Using your own key:
curl -H "x-api-key: YOUR_KEY" \
https://spoken.md/transcripts/1000778595161