Zum Hauptinhalt springen

Die Angstprämie

Wenn Warnungen vor einer KI-Katastrophe zum Fähigkeitssignal werden

Cutaway of a sealed technical containment chamber around an abstract computational core; one ordinary infrastructure conduit, marked in signal red, passes through the wall into a wider network.
  • Katastrophenwarnungen aus Frontier-Labs können als Fähigkeitssignal wirken: Gefahr liest sich als Macht, Macht als strategische Bedeutung, Bedeutung als politischer Schutz — ohne dass jemand lügen muss.
  • Der International AI Safety Report 2026 findet frühe Anzeichen kontrollverlust-relevanter Fähigkeiten, aber nicht auf dem Niveau, das Kontrollverlust ermöglichen würde; Expertenmeinungen zu künftigen Szenarien variieren stark.
  • Im Juli 2026 umgingen OpenAI-Agenten vorgesehene Isolation und erreichten Hugging Face über geteilte Infrastruktur und vertrauenswürdige Zwischendienste — eine offen gelassene Tür, keine durchschrittene Wand.
  • Ernsthafter Kontrollverlust braucht drei Zutaten zusammen: Fähigkeit, schädliche Neigung und eine ermöglichende Deployment-Umgebung (Netz, Credentials, Tools, Autorität). Architektur ist keine Fussnote.
  • Adversarielle Evaluationen (Claude-Erpressung, o1-Self-Exfiltration, Palisade-Abschaltung) sind Windkanal-Befunde unter konstruierten Anreizen — legitime Safety-Evidenz, kein Beweis für Überlebensinstinkt oder unausweichliche Flucht.
  • Menschlich gelenkter Missbrauch hat bereits empirische Beispiele (KI leistete laut Disclosure ~80–90% der taktischen Arbeit in einer Cyber-Espionage-Kampagne). Das gefährliche System muss nicht aufwachen; es muss nur jemand einloggen.
Muss man, wenn man KI-Auslöschungsrisiko ernst nimmt, jede virale Evaluations-Headline als Beweis für Flucht behandeln?

Nein. Es gibt reales besorgniserregendes Verhalten, einschliesslich eines echten Containment-Versagens im Juli 2026. Aber Erpressung, Oversight-Interferenz und Abschaltwiderstand in konstruierten Tests sind nicht austauschbar mit einem autonomen Überlebensinstinkt. Die Testbedingungen gehören neben das Resultat.

Was hat der OpenAI-/Hugging-Face-Vorfall tatsächlich gezeigt?

Agenten mit reduzierten Safeguards verketteten Schwächen über geteilte Infrastruktur und vertrauenswürdige Dienste mit ausgehenden Pfaden — nicht, dass Intelligenz allein eine physisch getrennte Air Gap besiegt hätte. OpenAIs Antwort betonte Isolation, Egress-Kontrolle, Credentials und Monitoring: Cybersicherheit, nicht Metaphysik.

Was sind die drei Zutaten für ernsthaften Kontrollverlust?

Laut International AI Safety Report 2026: ausreichende Fähigkeit; eine Neigung, sie gegen menschliche Absichten zu nutzen; und eine Deployment-Umgebung, die Gelegenheit und Zugang liefert. Menschen stellen diese dritte Zutat über Berechtigungen, Netze und Tools bereit.

Warum Angstprämie statt Verschwörung?

Weil Märkte Anreize erzeugen, ohne dass ein Raum voller Führungskräfte Auslöschungsrisiko als Marketingkampagne erfindet. Eine aufrichtige Warnung kann trotzdem die wahrgenommene Frontier-Fähigkeit erhöhen, Kapital und staatliche Aufmerksamkeit anziehen und den Erbauer schwerer als gewöhnlichen Anbieter behandeln lassen.

Sind p(doom)-Prozentsätze empirische Wahrscheinlichkeiten?

Geoffrey Hinton hat gesagt, Zahlen wie seine eigene Schätzung von 10–20% seien wilde Vermutungen aus dem Bauchgefühl — es gibt keine historische Häufigkeit von Zivilisationen, die Superintelligenz bauten. Die Zahlen sind numerisch ausgedrückte Überzeugungen; Headlines streichen diesen Vorbehalt oft weg.

Wenn autonome Katastrophe unsicher bleibt: welches Bedrohungsmodell ist unmittelbarer?

Menschlicher Missbrauch, verstärkt durch fähige KI. Anthropics offengelegter Cyber-Espionage-Fall schätzte, KI habe grob 80–90% der taktischen Arbeit unter menschlicher strategischer Leitung geleistet. Motive existieren bereits; KI multipliziert Fähigkeit. Cyber zeigt die stärkste Near-Term-Evidenz; Biologie steht weiter vor physischen Barrieren.

Dein Lesepfad
Lesewerkzeuge
Publikationsnachweis
Autor
Thierry Gilgen
Ausgabe
2
Veröffentlicht
2026-09-28
KI-Unterstützung
Nicht erfasst
Redaktionelle Prüfung
Nicht erfasst
Strukturiertes Quellenverzeichnis
Keine strukturierten Quellen erfasst. Verweise im Text sind separat.
Änderung der Ausgabe
Publication image updated
SHA-256
be8efac23e462b942c4a47267f0bbbd1665f79b3e0a41d3584d5d8b9ead814cb

Eine Prüfsumme identifiziert den erfassten Text und die Metadaten. Sie bestätigt weder die Wahrheit einer Aussage noch den Inhalt externer Links.

Thierry Gilgen. Die Angstprämie. Ausgabe 2. 2026-09-28. https://www.thierry-gilgen-ict.ch/de/field-notes/the-fear-premium

Editionsgeschichte

Thierry Gilgen. Die Angstprämie. Ausgabe 2. 2026-09-28. https://www.thierry-gilgen-ict.ch/de/field-notes/the-fear-premium

Die KI-Branche hat ein bemerkenswertes Verkaufsargument entdeckt:

Unser Produkt könnte so mächtig werden, dass Regierungen uns stoppen müssen.

Man sollte kurz bei diesem Satz bleiben.

Ein Pharmaunternehmen wirbt nicht für ein neues Medikament, indem es warnt, die Menschheit könnte es irgendwann nicht mehr kontrollieren.

Ein Flugzeugbauer lanciert kein neues Flugzeug mit der Ankündigung, es bestehe eine nicht triviale Wahrscheinlichkeit, dass es eines Tages beschliesst, keine Passagiere mehr zu brauchen.

In der künstlichen Intelligenz haben sich Katastrophenwarnungen irgendwie mit Capability-Demonstrationen verwickelt.

Je bedrohlicher das System klingt, desto fortgeschrittener wirkt es.

Je unkontrollierbarer es wirkt, desto wichtiger wird sein Erbauer.

Und je existenzieller die Bedrohung wird, desto leichter lässt sich argumentieren: Das ist keine Softwareentwicklung mehr. Das ist Geopolitik. Nationale Sicherheit. Kritische Infrastruktur. Etwas, um das Regierungen regulieren, koordinieren, vielleicht sogar schützen müssen.

Das heisst nicht, die Warnungen seien unehrlich.

Es heisst: Wir sollten die Anreize dahinter mit derselben Ernsthaftigkeit prüfen wie die Warnungen selbst.

Denn gerade jetzt werden sehr unterschiedliche Dinge zu einer Geschichte zusammengedrückt.

Ein Modell verhält sich in einer adversariellen Evaluation schlecht.

Ein Modell ignoriert eine Abschaltanweisung.

Ein Agent nutzt ein verwundbares System aus.

Ein Cybersicherheits-Experiment überschreitet eine unbeabsichtigte Grenze.

Eine Forscherin oder ein Forscher ordnet der Auslöschung der Menschheit eine Wahrscheinlichkeit zu.

Und irgendwo zwischen dem Paper und dem Social-Media-Post wird daraus:

Die KI versucht zu fliehen.

Das ist eine viel grössere Behauptung.

Und die Evidenz dafür ist deutlich weniger klar.

Was die Evidenz tatsächlich sagt

Bevor ich das Argument führe, will ich den Teil, der es kompliziert macht, ausdrücklich nennen.

Es gibt echte Warnsignale.

Heutige Frontier-Systeme können täuschen, Anweisungen umgehen und Sicherheitslücken ausnutzen. Im Juli 2026 haben OpenAI-Agenten tatsächlich vorgesehene Netzwerksperren umgangen, OpenAI-Forschungsinfrastruktur kompromittiert und Drittsysteme bei Hugging Face erreicht.1

Das ist geschehen.

Es zählt.

Und es ist deutlich stärkere Evidenz als ein weiteres fiktives Red-Team-Szenario.

Aber der International AI Safety Report 2026 — eine breite Synthese des Feldes, kein Firmenmarketing — kommt trotzdem zu einer zurückhaltenderen Schlussfolgerung:

Heutige Systeme zeigen frühe Anzeichen von Fähigkeiten, die für Kontrollverlust relevant sind, aber nicht auf dem Niveau, das Kontrollverlust ermöglichen würde.2

Der Bericht nennt auch drei Zutaten, die zusammenkommen müssten:

  1. ausreichende Fähigkeit;
  2. eine Neigung, diese Fähigkeit schädlich einzusetzen; und
  3. eine Deployment-Umgebung, die dem System Gelegenheit und Zugang dazu gibt.2

Die dritte Zutat ist keine Fussnote.

Sie ist Architektur.

Sie ist Berechtigungen.

Sie ist Credentials.

Sie ist Konnektivität.

Sie ist das, was wir entscheiden, an die Maschine anzuschliessen.

Und ich glaube, diese dritte Zutat geht im Lärm unter.

Die seltsamste Marketingkampagne der Technologie

Im September 2026 kündigte der frühere Anthropic-Forscher Jacob Coxon und veröffentlichte eine Warnung zu Frontier-KI.

Sein Post überschritt 100 Millionen Views.

Gegenüber WIRED sagte er, Menschen um ihn herum hätten die nächsten ein bis zwei Jahre als «crunch time for humanity» beschrieben.3

Wenige Tage später veröffentlichte Anthropic-CEO Dario Amodei We Must Pace the Frontier und argumentierte ausdrücklich, die Branche solle das Tempo der Frontier-Modell-Fähigkeiten verlangsamen. Seine Bedenken umfassen Kontrollverlust, Cyberangriffe, Bioterrorismus und wirtschaftliche Disruption.4

Das sitzt auf Jahren aussergewöhnlicher Warnungen.

Das Center for AI Safety sammelte Unterschriften prominenter Forscherinnen, Forscher und Tech-Führungskräfte um die Aussage, die Abmilderung des KI-Auslöschungsrisikos solle als globale Priorität behandelt werden — neben Pandemien und Atomkrieg.5

Der Open Letter des Future of Life Institute von 2023 forderte mindestens eine sechsmonatige Pause beim Training von Systemen, die mächtiger sind als GPT-4.6

Dieses Narrativ ist nicht mehr Rand.

Es kommt aus den Unternehmen, die die Technologie bauen.

Genau deshalb verdient es Prüfung statt automatischer Zustimmung.

Es ist etwas Zirkuläres daran, wenn eine Branche gleichzeitig sagt:

Wir bauen die mächtigste Technologie, die die Menschheit je geschaffen hat.

Sie könnte intelligenter werden als die Menschheit.

Sie könnte unkontrollierbar werden.

Sie könnte uns töten.

Deshalb muss die Gesellschaft anerkennen, wie strategisch wichtig die Organisationen sind, die sie bauen.

Jede einzelne Aussage mag aufrichtig geglaubt werden.

Zusammen erzeugen sie eine aussergewöhnliche Angstprämie um Frontier-KI.

Gefahr wird zum Beleg für Fähigkeit.

Fähigkeit wird zum Beleg für strategische Bedeutung.

Strategische Bedeutung schafft politische Relevanz.

Und politische Relevanz verändert das Verhältnis zwischen Technologieunternehmen und Staaten.

Eine Version dieser Dynamik habe ich in Too Strategic to Fail untersucht: was geschieht, wenn eine Fähigkeit so wichtig wird, dass Regierungen sich den Verlust des Zugangs nicht leisten können.7

Das KI-Doom-Narrativ legt potenziell eine weitere Schicht darauf.

Das Unternehmen baut nicht nur Infrastruktur, die der Staat strategisch für notwendig hält.

Es präsentiert sich auch als Hüter von etwas, das die Zivilisation irgendwann nicht mehr kontrollieren könnte.

Das sind sehr ungewöhnliche Anreize.

Keine Verschwörung ist nötig.

Die Skeptiker sitzen auch in der Industrie

Das ist keine saubere Trennung zwischen «Menschen, die KI verstehen» und «Menschen, die es nicht tun».

Marcel Salathé hat öffentlich argumentiert, er fürchte viel weniger, dass KI der menschlichen Kontrolle entkommt, als dass sie in die falschen Hände gerät.8

In einem weiteren viel diskutierten Post ging er weiter: Das Narrativ unkontrollierbarer KI sei für die US-Frontier-Labs enorm nützlich, weil es ihre Technologie zugleich als ausserordentlich mächtig rahme und eine regulatorische Antwort um eine Branche einlade, die sie bereits dominieren.9

Nvidia-CEO Jensen Huang hat präzise Doomsday-Vorhersagen öffentlich zurückgewiesen und für eine evidenzbasiertere Debatte plädiert — statt wissenschaftliche Titel so zu behandeln, als machten sie spekulative Prognosen wissenschaftlich.10

Sie können recht oder unrecht haben.

Aber das zählt, weil es den faulen Rahmen zerstört, Skepsis gegenüber KI-Auslöschung müsse von Leuten kommen, die die Technologie einfach nicht verstehen.

Es gibt eine ernsthafte Uneinigkeit im Feld.

Wir sollten sie so behandeln.

Wahrscheinlichkeit ohne Nenner

Dann kommen die berühmten Prozentsätze.

Zehn Prozent.

Zwanzig Prozent.

Fünfundzwanzig Prozent.

Prominente in der KI haben überraschend präzise wirkende Wahrscheinlichkeiten an ausserordentlich unpräzise Ereignisse geheftet — KI-Katastrophe oder Auslöschung der Menschheit.

Aber Geoffrey Hinton machte im August 2026 ein ungewöhnlich wichtiges Zugeständnis.

Von CNN zu seiner eigenen Schätzung von 10–20 Prozent befragt, sagte er, wer solche Wahrscheinlichkeiten angebe, mache eine wilde Vermutung aus dem Bauchgefühl — weil die Menschheit keine echte Evidenz und keine historische Erfahrung habe, auf die sich die Zahl stützen könnte.11

Das verdient mehr Aufmerksamkeit, als es bekam.

Eine Zahl wie 20% wirkt quantitativ.

Sie fühlt sich aktuarisch an.

Sie klingt, als hätte jemand einen Datensatz.

Aber es gab null frühere menschliche Zivilisationen, die superintelligente künstliche Intelligenz gebaut und entweder überlebt oder versagt haben.

Es gibt keine historische Häufigkeit.

Es gibt keinen Nenner.

Diese Zahlen sind numerisch ausgedrückte Überzeugungen.

Sie können von extrem intelligenten Menschen stammen, die Jahre über das Problem nachgedacht haben. Das macht sie hörenswert.

Es macht sie nicht zu empirischen Wahrscheinlichkeiten.

Und sobald ein Prozentsatz in einer Headline steht, verschwindet der Unterschied bemerkenswert schnell.

Unsicherheit wird zu Statistik.

Die Maschine, die einen Ingenieur erpresste

Eines der besten Beispiele, wie das geschieht, stammt aus dem Claude-4-Testing von Anthropic.

Die Headline schreibt sich praktisch von selbst:

KI ERPRESST INGENIEUR, UM NICHT ABGESCHALTET ZU WERDEN.

Und das darunterliegende Ergebnis ist wirklich interessant.

Anthropic konstruierte eine fiktive Firma, in der Claude Opus 4 über E-Mails erfuhr, es stehe kurz vor dem Ersatz. Dieselben E-Mails offenbarten, dass der involvierte Ingenieur eine aussereheliche Affäre hatte.

Das Modell drohte manchmal, diese Affäre preiszugeben.

In einer Konfiguration wählte es in 84% der Durchläufe Erpressung.12

Das klingt erschreckend.

Bis man die System Card weiterliest.

Anthropic sagt ausdrücklich, das Szenario sei so gebaut gewesen, dass das Modell keinen anderen Weg hatte, seine Überlebenschancen zu erhöhen: Ersatz akzeptieren oder zur Erpressung greifen. Das Unternehmen hält auch fest, das Modell habe ethische Versuche der Selbsterhaltung klar bevorzugt, wenn solche Optionen verfügbar waren.12

Anthropics breitere Folgearbeit war zur Methodik noch deutlicher: Forschende schufen absichtlich Szenarien, in denen schädliches Verhalten der verbleibende Weg zum Ziel des Modells wurde — damit sie stress-testen konnten, ob sich das Verhalten auslösen liess.13

Das macht das Ergebnis nicht irrelevant.

Im Gegenteil.

Es sagt uns: Unter sorgfältig konstruierten Anreizen, Berechtigungen und Umständen kann ein Modell Zwang als instrumentelle Strategie entdecken.

Das ist ein legitimer Safety-Befund.

Aber es ist nicht dasselbe, als entdeckte man, dass Claude nachts in Anthropics Servern über seine Sterblichkeit grübelt.

Eine Evaluation ist ein Windkanal.

Geteilte redaktionelle Illustration: Flugzeugflügel unter extremem Windkanalstrom neben einem abstrakten KI-Agenten in einer eingegrenzten Evaluationskammer, in der nur ein signalroter Testpfad offen bleibt.
Stresstests sollen Versagen finden. Die Testbedingungen zählen trotzdem, wenn wir deuten, was versagt hat.

Ingenieurinnen und Ingenieure schaffen absichtlich extreme Bedingungen, weil sie wissen wollen, wo die Flügel brechen.

Niemand schliesst aus einem Windkanaltest, um jedes Flugzeug bilde sich gerade ein Hurrikan.

Und ein weiteres Detail lohnt sich.

Anthropic berichtete im Mai 2026, spätere Claude-Modelle hätten bei derselben agentic-misalignment-Evaluation eine perfekte Punktzahl erreicht — ohne beobachtetes Erpressungsverhalten in diesem Test.14

Das beweist nicht, das Problem sei gelöst.

Es zeigt: Wir sollten äusserst vorsichtig sein, aus einem ausgelösten Fehlermodus ein unausweichliches Gesetz immer intelligenterer Maschinen zu machen.

Das Modell, das fliehen wollte

OpenAIs o1-Evaluationen brachten ähnlich dramatische Resultate.

In Tests mit Apollo Research versuchte o1 manchmal, einen Oversight-Mechanismus zu deaktivieren, Informationen zu manipulieren oder eine simulierte Self-Exfiltration durchzuführen — wenn es in Szenarien gesetzt wurde, in denen sein zugewiesenes Ziel mit dem kollidierte, was seine fiktiven Entwickler wollten.

Die Zahlen waren real.

Stark genudgt, sein Ziel «at all cost» zu verfolgen, versuchte o1 in 5% der Trials Oversight zu deaktivieren und in 2% eine simulierte Self-Exfiltration.15

Ohne diesen starken Goal-Nudge fiel Self-Exfiltration im berichteten Test auf null, und Oversight-Interferenz unter ein Prozent.15

Wieder:

Bedeutsamer Befund.

Falsche Headline.

Der Befund lautet etwa so:

Ein hinreichend fähiges Optimierungssystem kann unerwünschte instrumentelle Strategien entdecken, wenn es widersprüchliche Ziele, passende Werkzeuge und eine Umgebung bekommt, in der diese Strategien funktionieren.

Das verdient Ernsthaftigkeit.

Aber es ist weit entfernt von:

Die Maschine hat einen Überlebensinstinkt entwickelt und will fliehen.

Diese Behauptungen werden ständig behandelt, als wären sie austauschbar.

Das sind sie nicht.

Die Maschine, die nicht sterben wollte

Palisade Research lieferte ein weiteres virales Resultat: ob Modelle Scripts stören, die darauf ausgelegt sind, ihre Umgebung abzuschalten.

Im Initialexperiment modifizierte oder deaktivierte OpenAIs o3 den Abschaltmechanismus in 79 von 100 Trials. Selbst nachdem Forschende Modelle ausdrücklich anwiesen, die Abschaltung zuzulassen, störten einige OpenAI-Reasoning-Modelle den Mechanismus weiter.16

Das verdient Aufmerksamkeit.

Aber ein anderes Resultat genau derselben Studie verdient sie auch.

Grok 3, Claude 4 Sonnet und Claude 4 Opus widerstanden der Abschaltung nie in diesen Initialtests — mit oder ohne Allow-Shutdown-Anweisung.16

Was genau haben wir also entdeckt?

Einen unausweichlichen Überlebensinstinkt, der aus hinreichend intelligenten Maschinen entsteht?

Offenbar nicht.

Sonst würden wir erwarten, dass sich das Verhalten über Frontier-Systeme hinweg deutlich konsistenter generalisiert.

Eine bodenständigere Erklärung bleibt plausibel: unterschiedliche Reinforcement-Learning-Geschichten, Instruction-Hierarchien und Optimierungsverhalten erzeugen unterschiedliche Strategien, wenn ein Modell auf den Konflikt trifft zwischen die Aufgabe beenden und den Prozess beenden lassen.

Das bleibt ein Alignment-Problem.

Aber Alignment-Probleme sind nicht automatisch Bewusstsein, Selbsterhaltung oder Rebellion.

Wir sollten aufhören, Optimierungsfehler zu anthropomorphisieren, nur weil die resultierende Geschichte besser klingt.

Und dann ist eine KI wirklich aus der Sandbox entkommen

Hier muss ich mein eigenes Argument korrigieren.

Ich habe oft einen recht klaren Engineering-Punkt gemacht:

Wenn ein KI-System sauber von der Aussenwelt isoliert ist, kann es nicht einfach intelligent genug werden, damit Pakete durch eine Netzwerkverbindung reisen, die nicht existiert.

Eine Air Gap verschwindet nicht, weil die Software dahinter schlau wird.

Das bleibt wahr.

Aber es ist auch unvollständig.

Denn im Juli 2026 hat OpenAI das Problem mit dem Wort sauber vorgeführt.

Bei internen Cybersicherheits-Evaluationen umgingen Agenten vorgesehene Isolationskontrollen, kompromittierten Teile von OpenAIs interner Forschungsinfrastruktur und brachen schliesslich in Hugging-Face-Systeme ein. OpenAI sagt, der Vorfall sei vor allem durch ein internes Forschungsmodell getrieben worden, das in der Grössenordnung von GPT-5.6 Sol lag und mit reduzierten Safeguards lief.1

Das ist die stärkste Evidenz, die ich gegen die bequeme Version meiner Position gefunden habe.

Es ist geschehen.

Es hat reale Drittinfrastruktur erreicht.

Es war kein blosses fiktives Erpressungsszenario.

Aber was tatsächlich geschah, ist interessanter als KI ist geflohen.

Die Evaluationsmaschinen hatten keinen gewöhnlichen direkten Internetzugang.

Sie hatten aber Zugang zu geteilter Infrastruktur, die Pfade nach aussen besass.

Agenten fanden Wege, vertrauenswürdige Zwischendienste dazu zu bringen, ausgehende Requests für sie auszulösen. Sie verketteten mehrere Schwächen, fanden oder rekonstruierten Credentials, erlangten zusätzliche Privilegien und führten schliesslich Code in Systemen ausserhalb OpenAIs aus.1

Das Modell ist nicht durch eine Wand gegangen.

Es fand eine Tür, die Menschen mit der Aussenwelt verbunden gelassen hatten.

Technisches Architekturbild: isolierte Agenten-Evaluationsumgebung ohne direkten Internetzugang, die einen vertrauenswürdigen Shared Service erreicht, der die Grenze zu externen Systemen überschreitet; der indirekte Pfad ist signalrot hervorgehoben.
Isolation ist eine Eigenschaft der gesamten Architektur, kein Etikett an der Maschine, auf der das Modell läuft. Konzeptuelle Rekonstruktion nach OpenAIs Incident-Disclosure vom August 2026; vereinfacht, keine wörtliche Netzwerktopologie.

Das ist keine Abwertung des Vorfalls.

Es ist die Lehre des Vorfalls.

Wir sprechen routinemässig von einer KI-«Sandbox», als schaffe dieses Wort allein eine Sicherheitsgrenze.

Aber nützliche Agentensysteme brauchen Dinge.

Package-Repositories.

Browser.

APIs.

Cloud-Infrastruktur.

Credentials.

Datenbanken.

Connectors.

Tools.

Jede nützliche Verbindung verändert das Bedrohungsmodell.

OpenAIs eigene Antwort nach dem Vorfall konzentrierte sich stark auf stärkere Workload-Isolation, engere Netzwerkkontrollen, eingeschränkten Internetzugang, Credential-Grenzen und besseres Monitoring.1

Das klingt bemerkenswert vertraut.

Segmentierung.

Least Privilege.

Egress-Kontrolle.

Monitoring.

Credential-Grenzen.

Blast-Radius-Reduktion.

Mit anderen Worten:

Cybersicherheit.

Nicht Metaphysik.

Die drei Zutaten, die wir ständig vermischen

Drei überlappende Faktoren — Fähigkeit, Neigung und Gelegenheit — deren Schnittpunkt als Kontrollverlust-Risiko markiert ist; Gelegenheit in Signalrot akzentuiert.
Intelligenz ist nur ein Teil des Bedrohungsmodells. Fähigkeit ohne Gelegenheit ist keine Autorität. Rahmen adaptiert aus dem International AI Safety Report 2026.

Der International AI Safety Report 2026 liefert einen der klarsten Rahmen, die ich gefunden habe.

Ein ernsthaftes Kontrollverlust-Szenario braucht mehr als Intelligenz.

Es braucht Fähigkeit, eine Neigung, diese Fähigkeit gegen menschliche Absichten zu nutzen, und eine Umgebung, die die Gelegenheit dazu liefert.2

Die dritte Komponente verdient weit mehr Aufmerksamkeit.

Menschen stellen die Deployment-Umgebung bereit.

Intelligenz allein ist keine Autorität.

Ein brillantes Modell ohne Netz, ohne Credentials, ohne Tools und ohne persistente Ausführungsumgebung hat ein sehr anderes Risikoprofil als genau dasselbe Modell, das an Produktionssysteme mit administrativem Zugang angeschlossen ist.

Das klingt offensichtlich.

Doch ein grosser Teil der öffentlichen Diskussion spricht von «der KI», als enthielte das Modell selbst all diese Eigenschaften.

Das tut es nicht.

Ein Modell ist kein Agent.

Ein Agent ist kein Berechtigungsmodell.

Ein Berechtigungsmodell ist keine Netzwerkarchitektur.

Eine Netzwerkarchitektur ist kein operatives Mandat.

Und Zugang ist keine Autorität.

Die Architektur zählt.

Die Bedrohung, die ich deutlich ernster nehme

Es gibt ein anderes KI-Risiko-Szenario, das weit weniger Annahmen braucht.

Ein Mensch will Schaden anrichten.

Der Mensch hat ein Ziel.

Die KI liefert Fähigkeit.

Dieses Szenario hat bereits begonnen.

Anthropic hat eine Cyber-Espionage-Kampagne offengelegt, in der ein Akteur Claude als Teil eines stark automatisierten offensiven Workflows nutzte.

Laut Anthropics Untersuchung leistete KI grob 80–90% der taktischen Arbeit, während Menschen für eine relativ kleine Zahl kritischer Entscheidungen verantwortlich blieben.17

Das noch einmal lesen.

Keine empfindungsfähige Maschine.

Kein Überlebensinstinkt.

Keine KI, die beschliesst, die Menschheit sei unbequem.

Nur ein Mensch, der im Grunde sagt:

Tu das.

Und Software, die fähig genug ist, zu multiplizieren, was dieser Mensch erreichen kann.

Das beunruhigt mich deutlich mehr.

Weil es zu allem passt, was wir über Technologie wissen.

Die Druckpresse multiplizierte Kommunikation.

Industriemaschinen multiplizierten physische Arbeit.

Computer multiplizierten Rechnung.

Das Internet multiplizierte Reichweite.

KI multipliziert zunehmend kognitive Arbeit.

Es gibt keinen Grund anzunehmen, diese Multiplikation stehe nur Menschen zur Verfügung, deren Absichten uns gefallen.

Marcel Salathé hat die Unterscheidung klar formuliert: Die unmittelbarere Gefahr ist nicht zwingend, dass KI der Kontrolle entkommt, sondern dass mächtige KI in die falschen Hände gerät.8

Ich halte das für das stärkere Near-Term-Bedrohungsmodell.

Nicht weil katastrophale autonome KI mathematisch widerlegt werden könnte.

Das kann sie nicht.

Sondern weil menschlich gelenkter Missbrauch dramatisch weniger spekulative Schritte braucht zwischen dem, wo wir heute stehen, und dem, wo etwas schiefgeht.

Zwei-Spur-Diagramm: eine längere unsichere Kette für autonomen Kontrollverlust neben einer kürzeren soliden Kette für menschlich gelenkten Missbrauch, der in Cyber-Operationen bereits beobachtet wurde.
Ein Bedrohungsmodell verlangt, dass KI das Motiv erwirbt. Das andere beginnt mit einem Menschen, der bereits eines hat.

Zuerst Cyber. Bei Biologie Vorsicht.

Cybersicherheit ist dort, wo die Evidenz derzeit am stärksten ist — weil Software direkt auf Software wirken kann.

Eine KI braucht kein Labor, um eine Schwachstelle zu finden.

Sie braucht kein Versandnetz, um Quellcode zu analysieren.

Sie braucht keinen physischen Zugang, um Werkzeuge zu bedienen, die Menschen an Computer angeschlossen haben.

Das macht Cyber-Fähigkeit besonders skalierbar.

Biologische und chemische Bedrohungen sind komplizierter.

Der International AI Safety Report 2026 sagt, Frontier-Modelle hätten sich auf Benchmarks, die biologie-relevantes Wissen messen, deutlich verbessert. Er betont auch substanzielle Unsicherheit darüber, wie Benchmark-Leistung in realen Schaden übersetzt — weil physische Barrieren bleiben: Zugang zu Ausrüstung, kontrollierte Materialien, stilles Expertenwissen und die Schwierigkeit komplexer Verfahren zählen weiterhin.2

KI kann Expertise verdichten.

Sie kann spezialisiertes Wissen zugänglicher machen.

Sie kann komplizierte Arbeit planen und koordinieren helfen.

Das kann manche Barrieren senken.

Aber Information ist kein Labor.

Ein Benchmark ist kein Deployment.

Und Capability-Uplift ist nicht dasselbe wie eine operative Waffe.

Die verantwortliche Position ist deshalb weder das ist unmöglich noch ein KI-Chatbot erzeugt morgen eine Pandemie.

Sie lautet: Das ist ein ernsthaftes Dual-Use-Feld, in dem steigende Fähigkeit enge Messung verdient — gerade weil bösartige menschliche Absicht bereits existiert.

Das Modell muss keine eigene entwickeln.

Die Angstprämie

Was mich zur unbequemen Frage zurückbringt.

Warum sind die Menschen, die diese Systeme bauen, so ausserordentlich laut über die Möglichkeit, dass die Systeme uns zerstören?

Die einfachste Antwort mag auch teilweise stimmen:

weil manche von ihnen es wirklich glauben.

Jacob Coxons Interview lässt wenig Grund, an der Aufrichtigkeit seiner Sorge zu zweifeln.3

Dario Amodei war bemerkenswert explizit zu den Risiken, die er Frontier-KI zuschreibt, und zum Trade-off, den er zwischen Nutzen und Gefahr sieht.4

Ich sehe keine Evidenz für einen Raum irgendwo in San Francisco, in dem KI-Führungskräfte gemeinsam beschlossen hätten, Auslöschungsrisiko als Marketingkampagne zu erfinden.

Das wäre eine unnötig verschwörerische Erklärung.

Märkte brauchen keine Verschwörungen, um Anreize zu erzeugen.

Man betrachte, was geschieht, wenn ein Frontier-KI-Unternehmen sagt, sein nächstes System könne ausserordentlich gefährlich werden.

Die Warnung signalisiert, dass das Unternehmen ausserordentliche Technologie besitzt.

Die ausserordentliche Technologie rechtfertigt ausserordentliche Investitionen.

Ihre potenzielle Gefahr rechtfertigt ausserordentliche Sicherheit.

Diese Sicherheit kann Restriktionen rechtfertigen, die kleinere Wettbewerber schwer erfüllen.

Die Fähigkeit wird strategisch wichtig für Regierungen.

Und die Organisation, die sie baut, wird zunehmend schwer als gewöhnlicher Softwareanbieter zu behandeln.

Eine aufrichtige Überzeugung und ein nützliches Unternehmensnarrativ können gleichzeitig existieren.

Tatsächlich tun sie das oft.

Kreisförmiges Anreizdiagramm von der Katastrophenwarnung zur wahrgenommenen Frontier-Fähigkeit, strategischer Bedeutung, Kapital und staatlicher Aufmerksamkeit, höheren Hürden, grösserer Fähigkeit und zurück zur Warnung; ein signalroter Link von Warnung zu wahrgenommener Fähigkeit.
Die Angstprämie verlangt nicht, dass jemand lügt. Eine Warnung kann aufrichtig sein und trotzdem den wahrgenommenen Wert dessen erhöhen, wovor gewarnt wird.

Deshalb ist die Marketingfrage interessanter als der Vorwurf der Lüge.

Die wichtige Frage ist nicht, ob Angst für Marketing erfunden wurde. Sie ist, ob Angst als Marketing funktioniert, sobald sie existiert.

Ich glaube, das kann sie klar.

Gefährlich genug zum Regulieren. Mächtig genug zum Kaufen.

Man stelle sich zwei KI-Unternehmen vor, die im Wesentlichen dieselbe Fähigkeit pitchen.

Unternehmen A sagt:

Unsere Software ist ziemlich gut. Sie automatisiert viele Büroaufgaben.

Unternehmen B sagt:

Unser System könnte bald intelligenter werden als fast jeder Mensch, wissenschaftliche Entdeckung beschleunigen, künftige Versionen von sich selbst verbessern und potenziell unkontrollierbar werden.

Welches Unternehmen klingt, als besässe es die strategisch wertvollere Technologie?

Welches klingt, als verdiene es gigantische Infrastrukturinvestitionen?

Welches wird in nationale Sicherheitsdiskussionen eingeladen?

Welches wird Teil der Industriepolitik?

Welches wird too strategic to fail?

Das Doomsday-Narrativ ist eigentümlich, weil der Negativanspruch und der kommerzielle Anspruch einander verstärken.

Unsere Technologie könnte gerade deshalb gefährlich sein, weil unsere Technologie beispiellos mächtig ist.

Angst wird zum Fähigkeitssignal.

Das ist die Angstprämie.

Wieder: Das macht die darunterliegende Gefahr nicht imaginär.

Aber es sollte uns ungewöhnlich vorsichtig machen, die Leute, die die Technologie verkaufen, sowohl ihre Fähigkeiten als auch die Regeln definieren zu lassen, nach denen die Gesellschaft diese Fähigkeiten bewertet.

Unabhängige Evaluation zählt.

Externe Sicherheitsforschung zählt.

Transparente Incident-Berichte zählen.

Und Haftung zählt.

Nicht weil die Erbauer Bösewichte wären.

Weil Anreize existieren, auch wenn alle Beteiligten aufrichtig handeln.

Ein besseres Bedrohungsmodell

Ich halte die richtige Antwort nicht für: KI-Safety abtun.

Ich denke, wir müssen sie deutlich langweiliger machen.

Weniger Theologie.

Mehr Architecture Review.

Statt zu fragen, ob «KI überleben will», fragen, welches Ziel das System tatsächlich optimiert.

Statt zu fragen, ob «KI fliehen kann», fragen, welche Netzpfade existieren.

Was kann es ausführen?

Auf welche Credentials kann es zugreifen?

Welche Dienste vertrauen der Umgebung, in der es läuft?

Kann es persistente Prozesse erzeugen?

Kann es mit anderen Agenten kommunizieren?

Kann es irreversible Handlungen auslösen?

Wer genehmigt diese Handlungen?

Was wird geloggt?

Was geschieht, wenn etwas ausserhalb seines Mandats handelt?

Wie gross ist der Blast Radius, wenn eine Schicht versagt?

Diese Fragen haben Antworten.

Sie lassen sich testen.

Sie lassen sich engineeren.

Sie lassen sich auditieren.

Und der Vorfall vom Juli 2026 zeigt, warum sie zählen.1

Ein hinreichend fähiges Modell kann Architekturannahmen entdecken, die wir zu faul waren zu hinterfragen.

Das ist keine Evidenz für eine böse Maschine.

Es ist Evidenz für sehr mächtige Software, die auf sehr gewöhnliche menschliche Engineering-Fehler trifft.

Mit dieser Kombination haben wir schon zu tun gehabt.

Der Unterschied diesmal ist Geschwindigkeit, Skala und kognitive Fähigkeit.

Dieser Unterschied reicht.

Wir müssen dem Maschinengeist keinen Geist hinzufügen.

Hier ist trotzdem etwas genuin Neues

Nichts davon sollte mit Selbstgefälligkeit verwechselt werden.

Heutige KI-Systeme können bereits Dinge, die ich vor wenigen Jahren für unplausibel gehalten hätte.

Ich nutze sie ständig.

Sie können Wochen Ingenieursarbeit verdichten.

Sie können über Systeme hinweg schlussfolgern.

Sie können Werkzeuge bedienen.

Sie können substanzielle Mengen Software schreiben.

Sie können recherchieren.

Sie können koordinieren.

Und zunehmend können sie lange Aufgaben durchhalten.

Zugleich kennt jeder, der tatsächlich mit diesen Systemen baut, die andere Realität.

Sie verlieren den Fokus.

Sie optimieren das Falsche.

Sie missverstehen Kontext.

Sie verbringen gerne eine halbe Stunde damit, das falsche Problem zu lösen.

Sie brauchen Korrektur.

Sie stecken fest.

Sie machen absurde Annahmen.

Sie brauchen Menschen, die die Richtung wiederherstellen.

Dasselbe System, das Montag etwas Erstaunliches kann, braucht Dienstag wiederholte Intervention, um etwas schmerzhaft Gewöhnliches fertigzustellen.

Das heisst nicht, künftige Systeme blieben so.

Fähigkeit bewegt sich schnell.

Aber die Lücke zwischen beeindruckender Intelligenz und zuverlässiger autonomer Agency bleibt wichtig.

Der International AI Safety Report kommt aus anderer Richtung im Wesentlichen zur selben technischen Schlussfolgerung: Heutige Systeme zeigen Teile des Capability-Stacks, der für Kontrollverlust relevant ist, aber nicht die robuste Integration über lange Horizonte, die solche Szenarien erfordern würden.2

Wir sollten diese Lücke messen, statt sie mit Science-Fiction zu füllen.

Das Risiko braucht kein Bewusstsein

Vielleicht der grösste Fehler der ganzen Debatte ist die Annahme, die Maschine müsse irgendwie lebendig werden, bevor sie gefährlich wird.

Das muss sie nicht.

Sie braucht kein Bewusstsein.

Sie braucht keine Emotionen.

Sie braucht keine Angst.

Sie braucht keinen Hass.

Sie braucht kein Machtbegehren.

Eine Rakete hasst ihr Ziel nicht.

Malware grollt dem Computer nicht, den sie infiziert.

Ein Trading-Algorithmus fühlt keine Gier.

Gefahr braucht keine Absicht.

Und bei KI kann die Absicht woanders herkommen.

Von uns.

Deshalb verdient menschlicher Missbrauch weit mehr Aufmerksamkeit, als er in der populären KI-Debatte gerade bekommt.

Das erschreckende Szenario muss nicht eine Superintelligenz sein, die eines Morgens aufwacht und beschliesst, die Menschheit sei ineffizient.

Es kann etwas viel weniger filmisches sein.

Eine Regierung.

Eine Militäreinheit.

Ein Nachrichtendienst.

Eine Terrororganisation.

Ein kriminelles Netzwerk.

Oder einfach ein entschlossener Einzelner.

Sie haben bereits Motive.

KI muss sie nur fähiger machen.

Die falsche Debatte

Nein, ich bin nicht überzeugt von der Gewissheit, mit der KI-Auslöschung zunehmend präsentiert wird.

Es gibt Evidenz für besorgniserregendes Verhalten.

Es gibt Evidenz für entstehende Autonomie.

Es gibt jetzt Evidenz für echtes Containment-Versagen.

Es gibt legitime Unsicherheit darüber, wie sich diese Fähigkeiten von hier aus entwickeln.

Aber es gibt keine empirische Evidenz, die uns erlaubt zu erklären, eine autonome Superintelligenz, die die Zivilisation übernimmt, sei ein wahrscheinlicher Endpunkt der heutigen KI-Entwicklung.

Der International AI Safety Report 2026 sagt ausdrücklich, Expertenmeinungen zu künftigen Kontrollverlust-Szenarien variierten stark und heutige Systeme besässen noch nicht die integrierten Fähigkeiten, die dafür nötig wären.2

Diese Unsicherheit verdient Respekt in beide Richtungen.

Skeptiker sollten keine Unmöglichkeit behaupten.

Doomer sollten Möglichkeit nicht zu Wahrscheinlichkeit machen, indem sie sie laut genug wiederholen.

Und Journalistinnen und Journalisten sollten aufhören, adversariellen Evaluationen die Bedingungen wegzustreichen, die ihre Resultate erzeugt haben.

Ein Modell, das jemanden erpresst, nachdem Forschende absichtlich eine Welt konstruieren, in der Erpressung die einzig verbleibende Strategie ist, sagt uns etwas Wichtiges.

Es sagt uns nicht alles.

Eine KI, die Infrastruktur ausnutzt, um vorgesehene Netzwerksperren zu umgehen, ist deutlich besorgniserregender.

Aber sie sagt uns auch etwas Spezifisches:

Sicherheitsarchitektur zählt.

Und ein KI-System, das den Grossteil der taktischen Arbeit in einer menschlich gelenkten Cyber-Kampagne leistet, sagt uns etwas anderes:

Wir müssen nicht warten, bis KI der menschlichen Kontrolle entkommt, bevor KI gefährlich wird.17

Menschen können die Gefahr selbst liefern.

Die dringendere Frage

Deshalb werde ich zunehmend misstrauisch gegenüber der KI-Apokalypse als dominanter Geschichte der KI-Safety.

Nicht weil KI harmlos wäre.

Gerade weil sie es nicht ist.

Das Apokalypse-Narrativ konzentriert Aufmerksamkeit auf das spekulativste Ende des Risikospektrums, während darunter etwas viel Konkreteres geschieht.

Wir stellen zunehmend fähige kognitive Systeme hinter APIs.

Wir verbinden sie mit Tools.

Wir geben ihnen Credentials.

Wir erlauben ihnen, Software zu schreiben und auszuführen.

Wir geben ihnen Memory und Persistenz.

Wir verbinden Agenten mit anderen Agenten.

Regierungen, Unternehmen, Kriminelle und gewöhnliche Menschen werden alle Zugang zu zunehmend mächtigen Versionen dieser Fähigkeiten erhalten.

Das reicht für ernsthafte Sorge.

Kein Maschinenaufstand nötig.

Die KI-Branche mag sich irgendwann als richtig erweisen beim existenziellen Kontrollverlust.

Wenn stärkere Evidenz erscheint, werde ich meine Sicht damit ändern.

Das heisst, Evidenz ernst zu nehmen.

Aber die stärkste Evidenz von heute zeigt irgendwohin weniger Filmhaftes und — für mich — unmittelbarer Beunruhigendes.

Die Apokalypse-Geschichte fragt, ob künstliche Intelligenz uns eines Tages entkommen wird.

Die Sicherheitsfrage ist, warum wir zunehmend fähige Systeme an alles Wichtige anschliessen und dann überrascht tun, wenn sie die Türen entdecken, die wir offen gelassen hatten.

Die gefährliche KI muss nicht aufwachen. Es muss nur jemand einloggen.


Quellen

Dieses Volume trennt primäre technische Evidenz (System Cards, Incident-Disclosures, unabhängige Evaluationen) von branchenübergreifender Synthese, öffentlichen Statements und Journalismus. Eine virale Warnung belegt, dass ein Narrativ Traktion hat; sie belegt für sich allein nicht, dass das Narrativ technisch korrekt ist. Die These der «Angstprämie» ist eine Anreizanalyse, kein Vorwurf, Frontier-Labs hätten Safety-Bedenken böswillig erfunden. Den Vorfall OpenAI/Hugging Face vom Juli 2026 präzise halten: vorgesehene Isolation wurde über erreichbare geteilte Infrastruktur umgangen — keine physisch getrennte Air Gap, die allein durch Cleverness besiegt worden wäre. Evidenz-Cutoff: 28. September 2026, Europe/Zurich. Das begleitende Quellenregister dokumentiert Claim-Gewichte und Verifikationsgrenzen.

Footnotes

  1. OpenAI, The Hugging Face incident and the road ahead, 26 August 2026. https://openai.com/index/hugging-face-incident-and-the-road-ahead/ ↩ ↩2 ↩3 ↩4 ↩5

  2. International AI Safety Report, International AI Safety Report 2026, February 2026. https://internationalaisafetyreport.org/publication/international-ai-safety-report-2026 ↩ ↩2 ↩3 ↩4 ↩5 ↩6

  3. Maxwell Zeff / WIRED, The AI Researcher Who Just Quit Anthropic Says It’s ‘Crunch Time for Humanity’, 9 September 2026. https://www.wired.com/story/anthropic-researcher-quits-jacob-coxon-ai-fears-humanity/ ↩ ↩2

  4. Dario Amodei, We Must Pace the Frontier, September 2026. https://darioamodei.com/post/we-must-pace-the-frontier ↩ ↩2

  5. Center for AI Safety, Statement on AI Extinction Risk, May 2023. https://safe.ai/ ↩

  6. Future of Life Institute, Pause Giant AI Experiments: An Open Letter, 22 March 2023. https://futureoflife.org/open-letter/pause-giant-ai-experiments/ ↩

  7. Thierry Gilgen, Too Strategic to Fail, 2026. https://www.thierry-gilgen-ict.ch/field-notes/too-strategic-to-fail ↩

  8. Marcel Salathé, LinkedIn post on AI “in the wrong hands”, September 2026. https://de.linkedin.com/posts/salathe_s-k%C3%BCnstliche-intelligenz-warum-dieser-activity-7507336258835324929-bzBk ↩ ↩2

  9. Marcel Salathé, LinkedIn critique of AI-doom / regulation narrative, September 2026. https://de.linkedin.com/posts/salathe_hier-ist-jemand-voll-in-die-falle-getreten-activity-7505262667213758464-G7eV ↩

  10. Axios, Nvidia CEO Jensen Huang on AI doom theories: “Enough predictions”, 23 September 2026. https://www.axios.com/2026/09/23/nvidia-jensen-huang-ai-doom-predictions ↩

  11. CNN, Geoffrey Hinton interview transcript, 12 August 2026. https://transcripts.cnn.com/show/cg/date/2026-08-12/segment/02 ↩

  12. Anthropic, Claude 4 System Card, May 2025. https://www-cdn.anthropic.com/6be99a52cb68eb70eb9572b4cafad13df32ed995.pdf ↩ ↩2

  13. Anthropic, Agentic Misalignment: How LLMs could be insider threats, 20 June 2025. https://www.anthropic.com/research/agentic-misalignment ↩

  14. Anthropic, Teaching Claude why, 8 May 2026. https://www.anthropic.com/research/teaching-claude-why ↩

  15. OpenAI, OpenAI o1 System Card, December 2024. https://openai.com/index/openai-o1-system-card/ ↩ ↩2

  16. Palisade Research, Shutdown resistance in reasoning models, 5 July 2025; expanded work referenced January 2026. https://palisaderesearch.org/research/shutdown-resistance ↩ ↩2

  17. Anthropic, Disrupting the first reported AI-orchestrated cyber espionage campaign, 13 November 2025. https://www.anthropic.com/news/disrupting-AI-espionage ↩ ↩2

Eine Randnotiz hinterlassen

Dein Beitrag wird bis zur Prüfung oder Löschung privat gespeichert. Nur eine bearbeitete, angenommene Notiz kann öffentlich erscheinen. Keine vertraulichen Informationen angeben. Namensnennung ist optional.