KI-GEHEIMreport (Folge 150)

KI-GEHEIMreport (Folge 150)
KI-GEHEIMreport – 02.09.2026 | Arbeitsmarktguru

🔐 KI-GEHEIMreport

Was die Mächtigen heute schon wissen — bevor es die Masse erfährt

Tagesanalyse: 02.09.2026 | Herausgegeben von Sven Neuenfeldt | https://www.arbeitsmarkt.guru

Achtung, Entscheider:innen: Dieser Report ist kein Nachrichtenüberblick. Er ist vielmehr Ihre Navigationskarte durch eine Welt, die sich schneller verändert, als wir glauben.

Innerhalb von 48 Stunden haben die drei größten KI-Häuser dasselbe Thema besetzt. OpenAI stuft sein neues Modell erstmals als kritisch in der Fähigkeit ein, Sicherheitslücken selbst zu finden. Google stellt ein Modell vor, das Schwachstellen aufspürt und gleich Korrekturen vorschlägt. Anthropic liefert eine Ausbaustufe, die nur geprüfte Organisationen bekommen. Drei Häuser, ein Satz: Diese Fähigkeit ist zu scharf für den offenen Markt.

Am selben Tag las sich eine andere Meldung viel unspektakulärer. In Langflow, einem verbreiteten Open-Source-Baukasten für KI-Anwendungen, wird eine kritische Lücke aktiv ausgenutzt. Angreifer holen sich daraus genau die Dinge, mit denen Ihr Haus arbeitet: OpenAI-Schlüssel, AWS-Zugangsdaten, SSH-Keys, Umgebungsvariablen. Über 360 Versuche hat ein Sicherheitsdienstleister bis Anfang September gezählt.

Zwischen diesen beiden Meldungen liegt die Frage dieses Tages, und sie ist unbequem einfach. Während oben diskutiert wird, wer ein Modell zur Schwachstellensuche bekommen darf, liegt unten in vielen Häusern ein API-Schlüssel in einer Konfigurationsdatei, den vor zwei Jahren jemand angelegt hat, der inzwischen woanders arbeitet. Die Angriffsfläche entsteht nicht durch die neuen Fähigkeiten der Modelle. Sie entsteht durch die alten Gewohnheiten der Organisation.

Und genau das ist die gute Nachricht. Modellfähigkeiten können Sie nicht steuern. Ihre eigene Schlüsselablage schon.

IN 60 SEKUNDEN

OpenAI, Google und Anthropic haben binnen 48 Stunden Modelle mit Fähigkeiten zur Schwachstellensuche vorgestellt, jeweils nur für geprüfte Verteidiger freigegeben.

Eine kritische Lücke im KI-Baukasten Langflow wird aktiv ausgenutzt, um OpenAI- und AWS-Zugangsschlüssel aus Unternehmensinstallationen zu stehlen.

Uber streicht 3.300 Stellen, während die Notenbank von New York misst: Betriebe schulen weit häufiger um, als sie wegen KI entlassen.

Handlungsempfehlung des Tages: Machen Sie in dieser Woche eine Inventur aller KI-Zugangsschlüssel in Ihrem Haus, wer besitzt welchen, wo liegt er gespeichert, wann wurde er zuletzt gewechselt, und löschen Sie jeden Schlüssel, dem sich keine aktive Person und kein aktiver Zweck zuordnen lässt.

KATEGORIE 1: KI-Tool-Entwicklungen

ChatGPT (OpenAI) | Stand: 02.09.2026

[Einordnung der Woche – Ereignis vom 01.09.2026] OpenAI hat sein kommendes Modell Astra als erstes überhaupt oberhalb der Schwelle „Critical“ für Cyberfähigkeiten eingestuft, der höchsten Stufe des eigenen Preparedness Framework. Die Definition dieser Stufe: Ein Modell kann Zero-Day-Lücken aller Schweregrade in gehärteten realen Systemen ohne menschliches Zutun finden und funktionsfähig ausnutzen. Bei internen Tests fand Astra nebenbei zwei bislang unbekannte Schwachstellen, die jetzt geordnet an die Hersteller gemeldet werden. Die Ablehnungsquote bei schädlichen Cyberanfragen liegt nach Unternehmensangaben bei 91,5 Prozent gegenüber 59 Prozent beim Vorgängermodell. Der Zugang zu den scharfen Funktionen läuft zunächst über Alphatester und danach über ein Programm namens Daybreak Blue, ausdrücklich für die Verteidigungsseite. Für Ihr Haus ändert sich damit heute keine Konfiguration. Es ändert sich die Zeitrechnung: Was ein geprüfter Verteidiger im September bekommt, ist in der Regel neun bis achtzehn Monate später in irgendeiner Form breiter verfügbar. Wer seine Patchzyklen bisher in Quartalen gedacht hat, sollte diese Meldung als Terminhinweis lesen.

→ Quelle: openai.com/index/path-to-astra/, 01.09.2026 | ✓ bestätigt

Gemini (Google DeepMind) | Stand: 02.09.2026

Google hat am Reporttag zwei Modelle veröffentlicht, Gemini 3.8 Flash und Gemini 3.8 Flash Cyber, die dritte Flash-Ausgabe innerhalb von sechs Wochen. Das reguläre Modell verbessert sich nach Herstellerangaben deutlich bei mehrstufiger Softwareentwicklung und bei agentischen Aufgaben und erreicht 54,9 Prozent auf HLE-Verified. Der Einführungspreis liegt bis zum 31.12.2026 bei 0,75 US-Dollar je Million Eingabe-Token und 3,75 US-Dollar je Million Ausgabe-Token. Die Cyber-Variante findet nach Google-Angaben in über 70 Prozent der internen Testfälle echte Schwachstellen in 20 Programmiersprachen und schlägt in 47,2 Prozent der Fälle eine funktionierende Korrektur vor. Sie ist nicht frei verfügbar, sondern läuft über das Fairwind-Programm mit Vorrang für Behörden, Betreiber kritischer Infrastruktur und Pflegende von Open-Source-Software. Zusätzlich verankert Google Gemini tiefer im Betriebssystem: Das September-Update für Android erlaubt im Find Hub, Standorte physischer Gegenstände samt Foto zu hinterlegen und später abzufragen. Für Beschaffung in Verwaltung und Mittelstand ist der Preis die relevante Zahl. Ein Modell dieser Leistungsklasse zu diesem Tarif verschiebt die Grenze, ab der sich eigene Fachanwendungen rechnen.

→ Quelle: blog.google, „Introducing Gemini 3.8 Flash and 3.8 Flash Cyber“, 02.09.2026; blog.google/fairwind-program | ✓ bestätigt

Claude (Anthropic) | Stand: 02.09.2026

[Einordnung der Woche – Ereignis vom 01.09.2026] Anthropic hat Claude Fable 5.1 und Claude Mythos 5.1 veröffentlicht. Der Listenpreis von Fable 5.1 liegt bei 10 US-Dollar je Million Eingabe-Token und 50 US-Dollar je Million Ausgabe-Token. Die eigentliche Änderung steckt im Kleingedruckten: Der Preis für Cache-Lesevorgänge sinkt um 75 Prozent auf 0,25 US-Dollar je Million Token. Anthropic beziffert die Ersparnis mit rund 25 Prozent bei üblichen Arbeitslasten und bis zu 45 Prozent bei agentischen Abläufen, also überall dort, wo ein Modell denselben Kontext wieder und wieder liest. Mythos 5.1 bleibt geprüften Organisationen vorbehalten, Verteidiger können sich über ein Cyber Verification Program bewerben. Verfügbar ist Fable 5.1 für Pro-, Max-, Team- und Enterprise-Konten sowie über AWS, Google Cloud und Microsoft Foundry. Wer in Ihrem Haus einen Assistenten betreibt, der dauerhaft auf einer festen Wissensbasis arbeitet, sollte die Rechnung des laufenden Monats mit der des Vormonats vergleichen. Genau dort schlägt diese Preisänderung durch, nicht im Listenpreis.

→ Quelle: anthropic.com/claude/fable, 01.09.2026; MarkTechPost, 01.09.2026 | ✓ bestätigt

Perplexity | Stand: 02.09.2026

[Einordnung der Woche – Ereignis vom 01.09.2026] Perplexity hat für seinen Computer-Agenten eine Funktion namens Hybrid Compute freigeschaltet. Die Aufgabenteilung: Das Modell in der Cloud übernimmt Recherche, Planung und anspruchsvolles Schließen, ein lokal auf dem Rechner laufendes Modell verarbeitet private Dateien und sensible Angaben. Dazwischen sitzt ein Prüfmechanismus auf dem Gerät, der Namen, Adressen, Kontonummern, Zugangsdaten und Ausweisnummern erkennt und entscheidet, ob er sie maskiert, lokal verarbeitet, verweigert oder rückfragt. Voraussetzung ist ein Mac mit Apple-Prozessor, macOS 15 oder neuer und mindestens 24 Gigabyte gemeinsamem Speicher. Als lokale Modelle kommen Gemma 4 E4B, Qwen3.6 35B-A3B und ein eigenes Modell zum Einsatz, Enterprise-Konten erhalten Verwaltungsrechte und Protokollierung. Das ist der erste Ansatz eines großen Anbieters, der die Datenschutzfrage nicht per Zusicherung, sondern per Architektur beantwortet. Für Personalabteilungen, Kanzleien, Kämmereien und Sozialleistungsbereiche ist genau das der Punkt, an dem KI-Nutzung vom Sonderfall zur Normalität werden kann. Prüfen Sie die Zusage trotzdem selbst, bevor Sie den ersten echten Vorgang darüberlaufen lassen.

→ Quelle: perplexity.ai/hub/blog/introducing-hybrid-compute-on-mac, 01.09.2026; VentureBeat, 01.09.2026 | ✓ bestätigt

Ohne Update heute: Microsoft Copilot (01.09.) · Manus (25.08.) · DeepSeek (23.08.) · Qwen (26.08.) · Kimi (16.07.) · GLM (28.08.) · MiniMax (26.08.)

KATEGORIE 2: Wirtschaftliche Entwicklungen

Ein chinesischer KI-Chip wird 6.109-fach überzeichnet, und das ist keine Kurslaune

Der von Tencent gestützte Chipentwickler Enflame hat seinen Börsengang am STAR Market in Shanghai abgeschlossen. Ausgabepreis 142,18 Yuan je Aktie, 43 Millionen Aktien, Erlös rund 6,1 Milliarden Yuan, etwa 911 Millionen US-Dollar. Die Nachfrage über den Online-Zeichnungsweg lag beim 6.109-Fachen des Angebots, die Zuteilungsquote bei 0,025 Prozent. 3,4 Millionen Aktien wurden von institutionellen zu privaten Zeichnern umgeschichtet. Enflame ist acht Jahre alt, schreibt Verluste, zählt zu den vier größeren chinesischen Beschleuniger-Entwicklern und hat mit Tencent zugleich Großaktionär und Hauptkunden. Die Mittel fließen in die fünfte und sechste Chipgeneration. Über drei bis fünf Jahre gelesen bedeutet diese Nachfrage etwas anderes als Euphorie: Kapital, das früher in westliche Lieferketten gegangen wäre, finanziert jetzt eine parallele Lieferkette, die von Exportkontrollen unabhängig sein soll. Für Ihr Haus ist das kein Beschaffungsthema von heute, aber ein Grund, bei Angeboten mit auffällig niedrigen Rechenkosten nach der Herkunft der Hardware zu fragen.

Handlungsempfehlung: Nehmen Sie in Ihre Anbieterprüfung für KI-Leistungen zwei Fragen auf, auf welcher Hardware und in welchem Land die Verarbeitung stattfindet, und lassen Sie sich die Antwort schriftlich geben. Ein Preisvorteil, dessen Herkunft Sie nicht benennen können, ist im Vergabeverfahren später nicht zu verteidigen.

→ Quelle: Reuters über Investing.com, „Tencent-backed Enflame IPO draws 6,109 times online demand“, 02.09.2026; Bloomberg, 02.09.2026 | ⚠ laut Sekundärquelle

Europas nächster KI-Rechner läuft mit AMD, und das ist eine politische Entscheidung

[Einordnung der Woche – Ereignis vom 31.08.2026] Der Zuschlag für LUMI-AI ist erteilt. Bull, die europäische Rechnersparte von Eviden, liefert das System für 387,8 Millionen Euro nach Finnland, bestückt mit AMD Instinct MI430X als Beschleuniger und AMD EPYC mit 256 Kernen als Hauptprozessoren. Auftraggeber ist das gemeinsame Unternehmen EuroHPC zusammen mit dem finnischen Konsortium. Nvidia kommt in dieser Konfiguration nicht vor. Das ist die erste europäische Großbeschaffung dieser Klasse, die den Marktführer bei KI-Beschleunigern auslässt, und sie sagt mehr über die Preis- und Verfügbarkeitslage als jede Analystenschätzung. Für Forschung, Hochschulen und industrienahe Einrichtungen entsteht damit ab Inbetriebnahme europäische Rechenkapazität, die nicht über einen US-Anbieter gebucht werden muss. Für alle anderen ist es ein Signal: Der Wechsel weg von einem einzigen Beschleuniger-Ökosystem ist technisch machbar geworden, auch wenn er Aufwand kostet.

Handlungsempfehlung: Wenn Sie eigene Modelle betreiben oder betreiben lassen, klären Sie mit Ihrem Dienstleister, ob Ihre Anwendungen an eine bestimmte Beschleuniger-Software gebunden sind, und lassen Sie sich den Aufwand für einen Wechsel beziffern. Diese Zahl brauchen Sie in der nächsten Vertragsverhandlung.

→ Quelle: AMD Newsroom, 31.08.2026; GlobeNewswire, „Bull Selected to Deliver Europe’s €387.8 Million LUMI-AI Supercomputer in Finland“, 31.08.2026 | ✓ bestätigt

Nvidia investiert in ein spanisches Start-up, das Rechenzentren mit Licht verkabelt

Das Photonik-Unternehmen iPronics aus Valencia hat 125 Millionen US-Dollar eingesammelt, unter den Geldgebern ist Nvidia. Die Technik: programmierbare optische Schaltkreise, die Verbindungen zwischen Rechenknoten im Bereich von Bruchteilen einer Millisekunde neu legen können, statt Daten über feste elektrische Leitungen zu schieben. Der Engpass in großen KI-Verbünden liegt seit geraumer Zeit nicht mehr bei der Rechenleistung einzelner Chips, sondern in der Verkabelung dazwischen. Dass ein europäisches Unternehmen in diesem Feld Geld vom größten Chiphersteller der Welt bekommt, ist für den Standort eine gute Nachricht und für die Kostenrechnung eine mittelfristige. Wenn sich Verbindungswege dynamisch umlegen lassen, sinkt der Anteil ungenutzter Rechenzeit, und genau dieser Anteil steckt heute in jedem Preis für gemietete Rechenleistung.

Handlungsempfehlung: Vereinbaren Sie in mehrjährigen Verträgen über Rechenleistung eine Preisüberprüfung nach spätestens 24 Monaten. Die Technik unter Ihrem Vertrag verändert sich schneller als Ihre Laufzeit.

→ Quelle: Reuters über TradingView, 02.09.2026; GlobeNewswire, „iPronics Raises $125 Million to Scale Programmable Optical Networking for AI Data Centers“, 02.09.2026 | ✓ bestätigt

KATEGORIE 3: Politische & Regulatorische Entwicklungen

EU: ChatGPT ist jetzt eine sehr große Suchmaschine, mit allem, was daran hängt

[Einordnung der Woche – Ereignis vom 31.08.2026] Die Europäische Kommission hat ChatGPT als sehr große Online-Suchmaschine nach dem Gesetz über digitale Dienste eingestuft, zusammen mit Reddit und Roblox als sehr große Online-Plattformen. Auslöser ist die Selbstauskunft der Anbieter, in der EU jeweils mindestens 45 Millionen monatlich aktive Nutzende zu erreichen. Ab vier Monaten nach der Zustellung, also ab Januar 2027, gelten die verschärften Pflichten: Bewertung und Minderung systemischer Risiken bei rechtswidrigen Inhalten, beim Schutz Minderjähriger, bei körperlicher und seelischer Unversehrtheit, bei Grundrechten, Wahlprozessen und öffentlicher Sicherheit, dazu unabhängige Prüfungen und Datenzugang für Forschende. Das ist die erste Einstufung eines KI-Assistenten unter dieses Regelwerk, und sie betrifft Sie mittelbar. Wenn ein Werkzeug, das in Ihrem Haus täglich läuft, europaweit unter Aufsicht steht, werden sich Antwortverhalten, Quellenangaben und Altersprüfungen ändern. Solche Änderungen kommen ohne Ankündigung in Ihren Arbeitsablauf.

Handlungsempfehlung EU: Benennen Sie für jedes extern betriebene KI-Werkzeug eine Person, die Änderungsmitteilungen des Anbieters verfolgt und im Team weitergibt, und legen Sie fest, welche Arbeitsschritte bei einer Verhaltensänderung des Werkzeugs erneut geprüft werden müssen. Ohne diese Zuständigkeit merken Sie Änderungen erst am Ergebnis.

→ Quelle: Europäische Kommission, digital-strategy.ec.europa.eu, „Commission designates ChatGPT, Reddit, Roblox under Digital Services Act“, 31.08.2026 | ✓ bestätigt

USA und Plattformrecht: Meta schaltet Kameras ab, und stellt damit eine Frage an Ihr Hausrecht

[Einordnung der Woche – Ereignis vom 01.09.2026] Meta hat nach eigenen Angaben bei Tausenden Datenbrillen die Kamerafunktion dauerhaft deaktiviert. Grund ist die Manipulation der Aufnahme-Leuchtanzeige, jener kleinen Leuchte, die Umstehenden signalisiert, dass gerade aufgenommen wird. Wer sie abklebt oder unbrauchbar macht, verliert die Kamera. Der Vorgang ist deshalb lehrreich, weil hier ein Hersteller eine Schutzfunktion für Dritte technisch durchsetzt, für Menschen also, die nie eingewilligt haben und die auch nicht Kundschaft sind. Für Ihr Haus stellt sich die Frage eine Ebene tiefer und wird selten gestellt: Was gilt bei Ihnen, wenn jemand eine solche Brille im Sitzungszimmer, in der Werkstatt, am Empfangstresen oder im Beratungsgespräch trägt? Personalräte und Betriebsräte haben hier ein Mitbestimmungsthema, das noch fast nirgends geregelt ist, und Beschäftigte haben ein Recht darauf, es geregelt zu wissen.

Handlungsempfehlung Deutschland und EU: Ergänzen Sie Ihre Hausordnung oder Ihre Dienstvereinbarung um eine Regelung zu am Körper getragenen Aufnahmegeräten, und klären Sie sie einmal aktiv in einer Teambesprechung. Eine Regel, die niemand kennt, schützt niemanden.

→ Quelle: Semafor, „Meta disables cameras on thousands of tampered smart glasses“, 01.09.2026; Quartz, 02.09.2026 | ⚠ laut Sekundärquelle

Deutschland und China

Aus Berlin und Peking lag im Recherchefenster keine primärquellenfeste Neuigkeit vor.

KI & ARBEIT

💼 Uber streicht 3.300 Stellen und baut jede fünfte Führungsposition ab, offiziell ohne KI-Begründung

Quelle: TechCrunch, „Uber is laying off 10% of staff, or 3,300 people“, 02.09.2026; Bloomberg, 02.09.2026 | Datum: 02.09.2026 | ⚠ laut Sekundärquelle

Uber trennt sich von rund 3.300 Beschäftigten, etwa zehn Prozent der Belegschaft. Der Umbau trifft gezielt die Struktur: 20 Prozent weniger Führungspositionen, die Hälfte aller Ein- und Zwei-Personen-Teams entfällt, Rollen jenseits der siebten Ebene unterhalb der Geschäftsführung werden gestrichen, Entwicklung und Auslieferung werden zusammengelegt. Zugleich endet die Ortsflexibilität für nahezu alle, weniger als ein Prozent der Stellen bleibt ortsunabhängig. Vorstandschef Dara Khosrowshahi begründet das mit angewachsener Komplexität, ausdrücklich nicht mit KI. Investiert wird in Fahrdienst, Lieferung und Robotaxi. Genau diese Begründungslücke ist das Interessante. Wenn ein Konzern zehn Prozent abbaut, gleichzeitig in Automatisierung investiert und dabei betont, das eine habe mit dem anderen nichts zu tun, dann ist das keine Aufklärung, sondern eine Formulierungsentscheidung. Aus 40 Jahren Arbeitsmarkt kenne ich dieses Muster: Der Abbau wird mit Struktur begründet, weil Struktur keine Mitbestimmung auslöst und keine Debatte über Qualifizierung eröffnet. Für Beschäftigte macht das keinen Unterschied. Für Führungskräfte in Mittelstand und Verwaltung schon, denn die ehrliche Variante ist die anschlussfähigere: Wer sagt, welche Tätigkeiten sich verändern, kann Menschen darauf vorbereiten. Wer von Komplexität spricht, kann es nicht.

Handlungsempfehlung: Wenn in Ihrem Haus Stellen oder Aufgaben wegfallen, benennen Sie in der Kommunikation den tatsächlichen Grund und sagen Sie im selben Atemzug, welche Qualifizierung Sie den Verbleibenden anbieten. Eine unbenannte Ursache erzeugt Gerüchte, die teurer sind als jede Weiterbildung.

💼 Die Notenbank von New York misst nach: Vier Prozent entlassen wegen KI, ein Drittel schult um

Quelle: Federal Reserve Bank of New York, Liberty Street Economics, „Businesses Are Using AI to Transform Work, Not Cut Jobs“, Abel, Deitz, Emanuel, Montalbano | Datum: 01.09.2026 | ✓ bestätigt [Einordnung der Woche – Ereignis vom 01.09.2026]

Die regelmäßigen Betriebsbefragungen der New Yorker Notenbank, erhoben im August 2026 im Bundesstaat New York und im Norden New Jerseys, zeichnen ein Bild, das der Schlagzeilenlage widerspricht. 61 Prozent der Dienstleister und 51 Prozent der Industriebetriebe setzen KI ein, deutlich mehr als 2025. Entlassen haben deswegen vier Prozent der Dienstleister und null Prozent der Industriebetriebe. 15 Prozent der Dienstleister stellen weniger ein, 13 Prozent stellen mehr ein, um KI überhaupt nutzen zu können. Über ein Drittel der Dienstleister und mehr als ein Fünftel der Industriebetriebe haben vorhandene Beschäftigte umgeschult. Die Autor:innen ordnen die Investitionen ausdrücklich als bescheiden ein und die Nutzung als auf wenige Beschäftigte konzentriert. Zwei Lesarten stehen nebeneinander, und beide stimmen. Die beruhigende: Umschulen ist der Normalfall, Ersetzen die Ausnahme. Die unbequeme: Die Nutzung konzentriert sich auf einen kleinen Teil der Belegschaft, und das ist die Spaltung, über die in zwei Jahren geredet wird. Regionale Daten aus den USA lassen sich nicht eins zu eins auf deutsche Verhältnisse übertragen. Die Richtung ist trotzdem belastbar, weil sie über zwei Jahre hinweg stabil gemessen wurde.

Handlungsempfehlung: Zählen Sie einmal nach, wie viele Ihrer Beschäftigten das im Haus verfügbare KI-Werkzeug im letzten Monat tatsächlich benutzt haben, und vergleichen Sie diese Zahl mit der Zahl der vergebenen Lizenzen. Die Lücke zwischen beiden Zahlen ist Ihr Qualifizierungsbedarf, und sie kostet Sie heute schon Geld.

KATEGORIE 4: Radar – Signale & Forschung

Methodik: öffentlich crawlbare Quellen, kein Live-Scan sozialer Medien. Eigenständige Prüfung empfohlen.

🔭 Signal: Der Angriff kommt nicht über das Modell, sondern über den Baukasten davor

Quelle: BleepingComputer, „Critical Langflow flaw exploited to steal OpenAI and AWS keys“ | Datum: 01.09.2026

In Langflow, einem verbreiteten Open-Source-Werkzeug zum Zusammenklicken von KI-Abläufen, wird die kritische Lücke CVE-2026-0768 aktiv ausgenutzt. Der Fehler steckt im Prüfmechanismus für eigene Komponenten und erlaubt es, ohne Anmeldung beliebigen Python-Code auszuführen. Erbeutet werden Langflow-Administratorschlüssel, OpenAI-API-Schlüssel, AWS-Zugangsdaten, Umgebungsvariablen und SSH-Keys. Der Sicherheitsdienstleister VulnCheck hat bis Anfang September mindestens 360 Ausnutzungsversuche gezählt, die frühen Zugriffe kamen überwiegend aus Russland. Abhilfe schafft Version 1.11.6 oder neuer. Relevant ist das für jedes Haus, in dem eine Fachabteilung ohne die IT einen KI-Baukasten aufgesetzt hat, und das sind mehr, als in den meisten Organigrammen stehen.

Reife-Level: Emerging

🔭 Signal: Runway erzeugt Programmoberflächen als Video, ohne dass darunter Code läuft

Quelle: the-decoder.com, „Runway’s Solaris is an AI system that generates software interfaces in real time“ | Datum: 01.09.2026

Runway hat Solaris vorgestellt, ein System, das Bedienoberflächen Bild für Bild in Echtzeit erzeugt, mit 720p und ohne ausführbaren Programmcode darunter. Ein Sprachmodell entscheidet, wie sich die Oberfläche entwickeln soll, ein Weltmodell zeichnet jedes einzelne Bild. Klicks, Ziehbewegungen und Sprachbefehle funktionieren, feste Anwendungen braucht es nicht. Runway benennt die Grenzen selbst: Textdarstellung bleibt unzuverlässig, Langzeitstabilität ist ungelöst, Bildschirmleseprogramme werden nicht unterstützt, und ein falsches, aber überzeugend aussehendes Ergebnis sei schlimmer als gar keines. Genau dieser letzte Satz macht das Signal wertvoll. Wenn Oberflächen erzeugt statt programmiert werden, verschiebt sich Barrierefreiheit von einer Anforderung an das Programm zu einer Anforderung an das Modell, und die Barrierefreiheitsstärkungsgesetze kennen diese Kategorie noch nicht. Verfügbar ist Solaris bisher nur als Forschungsprojekt mit Bewerbungsverfahren.

Reife-Level: Früh-Signal

📄 What Does an Agentic Software Engineering Benchmark Measure?

Autor:innen: Radin Shayanfar, Keheliya Gallaba, Ahmed E. Hassan | Erschienen: 01.09.2026 | Quelle: arXiv:2609.01271

Kernerkenntnisse: Die Autor:innen zeigen, dass gängige Etiketten für Benchmark-Aufgaben wie „Fehlerbehebung“ die tatsächliche Schwierigkeit verdecken. Ihr Profil aus den drei Größen Streuung, Neuheit und Zentralität trennt jedes untersuchte Benchmarkpaar auf mindestens zwei Achsen, und die Unterschiede lassen sich auf Entscheidungen bei der Zusammenstellung zurückführen. Wie eine Aufgabe formuliert ist, verändert das Verhalten des Agenten messbar: Bei unscharfen Anforderungen produzieren Agenten größere Lösungen, bei aufgeblähten Musterlösungen kleinere. Erfolg konzentriert sich bei allen Modellgrößen auf die einfachen Bereiche des Profils, die Wege dorthin unterscheiden sich je nach Modellfamilie.

Praktische Relevanz für KMU und öffentliche Einrichtungen: Wenn ein Anbieter Ihnen Benchmarkwerte für einen Programmier- oder Bearbeitungsagenten vorlegt, sagt die Zahl weniger über Ihre Aufgaben aus, als die Folie suggeriert. Der belastbare Vergleich bleibt der eigene Testlauf an fünf echten Vorgängen aus dem eigenen Haus.

Verifikationsstatus: ⚠ Preprint, noch nicht peer-reviewed

📄 Does Fault Localization Beat a Fresh Attempt? A Placebo-Controlled Study of Test-Guided Code Repair

Autor:innen: Anik Jha | Erschienen: 01.09.2026 | Quelle: arXiv:2609.00854

Kernerkenntnisse: Die Studie prüft an 488 fehlgeschlagenen Lösungsversuchen und Modellen mittlerer Größe, ob es hilft, ein Modell gezielt auf die vermutete Fehlerstelle zu lenken. Verglichen werden drei Wege: neuer vollständiger Versuch, gezielte Fehlerlokalisierung und als Kontrollgruppe das Bearbeiten einer zufälligen, unbeteiligten Stelle. Ergebnis: Der schlichte neue Versuch schlägt die gezielte Lokalisierung deutlich, im Verhältnis 40 zu 3. Nur in 9 Prozent der Fälle liegen überhaupt die Daten vor, die eine Lokalisierung erlauben würden. In knapp der Hälfte der gezielten Eingriffe schreibt das Modell den entfernten Code wortgleich zurück. Der Sparsamkeitsvorteil bleibt bestehen, 21,7 gegenüber 371,1 Token, nur nützt er nichts.

Praktische Relevanz für KMU und öffentliche Einrichtungen: Wer KI-gestützte Fehlerbehebung einsetzt, sollte das Werkzeug lieber mehrere vollständige Lösungen erzeugen lassen, statt es auf eine vermutete Stelle festzunageln. Das ist eine Einstellungsfrage, keine Investition, und sie lässt sich in der nächsten Woche ausprobieren.

Verifikationsstatus: ⚠ Preprint, noch nicht peer-reviewed

„Je leistungsfähiger die KI wird, desto menschlicher müssen wir werden.“

Dieser Report erscheint i.d.R. täglich.
Weitergabe mit Quellenangabe ausdrücklich erwünscht.
Kommen wir ins Gespräch. Ich freue mich auf den Austausch.

Sven Neuenfeldt | Arbeitsmarktguru
Bleiben Sie neuGIERig! Wir müssen raus aus unserer Komfortzone.

AI MODIFIED – Offizielles EU-KI-Kennzeichen nach Art. 50 EU AI Act KI-unterstützt erstellt · Redaktionelle Verantwortung: Sven Neuenfeldt, Arbeitsmarktguru

KI-GEHEIMreport · Arbeitsmarktguru · Sven Neuenfeldt
Ausgabe 2026-09-02 · Redaktionsschluss: Mittwoch, 02.09.2026, 23:59 Uhr (MEZ/MESZ)

Die Inhalte dieses Briefings dienen ausschließlich der allgemeinen Information. Sie stellen in keinster Weise eine Rechts-, Steuer-, Finanz-, Anlage- oder sonstige Fachberatung dar. Alle verlinkten Inhalte stammen aus zum Zeitpunkt der Recherche öffentlich zugänglichen Quellen. Für den Inhalt externer Websites sind ausschließlich deren Betreiber:innen verantwortlich.

Dieses Briefing entsteht auf Basis von Sven Neuenfeldts eigenem Fachwissen, ergänzt durch Recherchen mit Künstlicher Intelligenz (KI), und wird manuell zusammengestellt. Die inhaltliche Verantwortung liegt bei Sven Neuenfeldt, Arbeitsmarktguru. Jede Ausgabe wird vor Veröffentlichung redaktionell geprüft. Eine eigenständige Verifikation relevanter Informationen wird dennoch empfohlen. Sollten Ihnen Ungenauigkeiten auffallen, melden Sie sich gerne, jeder Hinweis hilft. Die verlinkten Originaltexte unterliegen dem jeweiligen Urheberrecht der Herausgeber.

© 2026 Arbeitsmarktguru | Alle Angaben nach bestem Wissen und Gewissen recherchiert, ohne Gewähr. Rechtlichen Hinweis und Haftungsausschluss beachten. Weitergabe mit Quellenangabe erlaubt (nicht-kommerziell).

Stand: 02.09.2026


Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert