Ein Hörsaal an der Universität des Saarlandes, Institut für Informatik. Vorn steht ein Mann, der gleich einen Vortrag über Fairness und Genauigkeit in KI-Systemen halten wird. Sein Publikum: Studierende, mitten in einer Promotion zu genau diesem Thema. Sein eigenes Fachwissen dazu: keines.
Der Mann heißt Erik. Journalist, kein Informatiker. Den Vortrag hat nicht er geschrieben. ChatGPT hat ihn geschrieben – Gliederung, Fachbegriffe, sogar einen Insider-Witz für Informatiker. Erik hat abgelesen, geübt, präsentiert. Dokumentiert hat das die 3sat-Wissenschaftssendung „nano“ in ihrem Beitrag „Wie KI das Studium für immer verändert“.
Und hier beginnt, was uns alle etwas angeht: Es hat fast funktioniert.
Die Studierenden hörten aufmerksam zu. Höflich, konzentriert, mit dem Vertrauensvorschuss, den ein Publikum jedem am Rednerpult automatisch gewährt. Erst als die Fragen kamen, kippte die Stimmung. Nicht sofort. Aber spürbar.
Warum uns dieser Saarbrücker Selbstversuch etwas angeht
Was in diesem Hörsaal als Experiment lief, passiert in Unternehmen und Behörden längst im Ernstfall – nur ohne Auflösung am Ende. Der Bewerber, dessen Fallstudie bei genauem Hinsehen eine gut formulierte KI-Ausgabe ist. Die Projektleitung, die eine Roadmap vorträgt, deren Kernthesen sie selbst nicht mehr erklären kann, sobald man nachhakt. Der Trainer, der ein Workshop-Konzept präsentiert, das eine Stunde vorher generiert wurde.
Im Hörsaal gab es am Ende ein Geständnis, ein Lachen, eine Lehre für alle Beteiligten. Im Bewerbungsgespräch, im Projektreview, in der Weiterbildungsabnahme gibt es diese Auflösung selten. Die Fassade bleibt stehen – bis sie genau dort bricht, wo Kompetenz wirklich gebraucht wird: im Kundengespräch, im Ernstfall, im Gemeinderat.
Die Bildungsexpertin, die das Experiment begleitete, bringt die Lage auf den Punkt: Die meisten Studierenden wollen tatsächlich lernen und würden KI nicht nutzen, um sich vollständig durchzumogeln. Das eigentliche Problem liegt woanders. Sobald jemand eine Leistung mit KI-Unterstützung erbracht hat, lässt sich das im Nachhinein kaum noch beweisen. Genau dieses Muster – schwer nachweisbar, aber folgenreich – begegnet uns nicht nur an Hochschulen. Es begegnet uns in jedem Auswahlverfahren, in jeder Angebotsprüfung, in jeder Präsentation, die wir für bare Münze nehmen.
Was kostet uns das, wenn wir es nicht bemerken? Eine Fehlbesetzung, die erst im dritten Monat aktenkundig wird. Ein Weiterbildungsbudget, das in Show investiert statt in Können. Eine Entscheidung, die auf einem Bericht beruht, der beeindruckend klang – und bei der ersten kritischen Rückfrage in sich zusammenfällt.
Deshalb lohnt sich ein genauer Blick auf das, was im Saarbrücker Hörsaal tatsächlich passiert ist. Es zeigt uns ein Werkzeug, das wir in Zukunft öfter brauchen werden.
Die Studierenden glaubten ihm – fast bis zum Schluss
Der Vortrag, den ChatGPT für Erik schrieb, war handwerklich sauber. Klare Gliederung, saubere Fachbegriffe, ein Bezug auf ein echtes wissenschaftliches Paper, das Erik zusätzlich eingespeist hatte. Auf Zuruf baute die KI sogar einen Insider-Witz für Informatiker ein und erhöhte den wissenschaftlichen Anspruch des Textes.
Aufschlussreich ist ein Detail aus der Entstehung: Erik ergänzte im Prompt, seine Karriere hänge vom Ergebnis ab. Die Qualität der Antwort zog daraufhin messbar an. Sprachmodelle reagieren auf Dringlichkeit, ohne dass echte Dringlichkeit dahintersteht. Genau darin liegt die erste Lehre dieses Experiments: Ein überzeugend klingender Text beweist kein Verständnis dahinter. Er beweist, dass ein Prompt gut formuliert wurde.
Im Saal selbst zeigte sich, wie weit reine Sprache trägt und wo ihre Grenze liegt. Der Insider-Witz verpuffte, kaum jemand lachte. Trotzdem blieb das Publikum wohlwollend. Studierende urteilen selten sofort über einen Gastredner – das ist keine Naivität, das ist gelernte akademische Höflichkeit. Diese Höflichkeit ist die Zeitspanne, in der eine Fassade aus geliehenem Wissen überleben kann.
Die zweite Frage entlarvt, was der erste Eindruck verschweigt
Die Wende kam nicht durch den Ton. Sie kam durch eine Nachfrage aus dem Publikum: ob Genauigkeit als Qualitätsmaßstab für Algorithmen überhaupt geeignet sei – und ob es nicht ganz neue Metriken brauche. Eine fachlich anspruchsvolle Frage zu einem Thema, das Erik angeblich seit Jahren erforschte.
Seine Reaktion: Er gab die Frage an die Runde zurück, statt sie zu beantworten. Ein zweiter Fragesteller hakte ähnlich präzise nach. Wieder folgte keine inhaltliche Antwort, nur eine ausweichende Zustimmung zur Fragestellung selbst.
Später, im offenen Gespräch, benannten die Studierenden genau diesen Moment als Kipppunkt. Verraten hat ihn nicht die Nervosität in seiner Stimme, auch nicht ein falsch betonter Fachbegriff aus seinem angeblichen Dissertationsthema, so auffällig der auch war. Verraten hat ihn der Moment, in dem die Fragen wirklich in die Tiefe gingen und seine Antworten allgemein blieben, wo sie konkret hätten werden müssen.
Das ist die Kernbeobachtung dieses Essays: Sprache verrät die Lücke nicht. Tiefe verrät sie. Ein KI-Text kann jeden Ton treffen, jede Gliederung sauber aufbauen, jeden Fachbegriff platzieren. Was er nicht ersetzen kann, ist die Fähigkeit, auf eine unerwartete, spezifische Frage mit einer ebenso spezifischen Antwort zu reagieren – weil dahinter kein Verständnis steht, das sich variieren lässt.
Das wird nicht einfacher, es wird schwieriger. Je besser die Sprachmodelle werden, desto weniger hilft uns das Gefühl, einen KI-Text am Klang zu erkennen. Was bleibt, ist die Tiefe der Prüfung – nicht die Technik dahinter.
Die gleiche Lücke wartet in Ihrem nächsten Bewerbungsgespräch
Übertragen wir das auf unseren Alltag in Unternehmen und Verwaltung. Wir laden für Vorstellungsgespräche Menschen ein, deren Bewerbungsunterlagen glänzend formuliert sind. Wir beauftragen Beratungen, deren Angebote druckreif klingen und wie oft sitzen wir in Projektreviews, in denen die Folien schlüssig wirken und niemand nachfragt, weil die Struktur erstmal überzeugt.
Das ist keine Kritik an einzelnen Führungskräften. Die meisten von uns wurden nie darin geschult, flüssige Präsentation von echtem Verständnis zu unterscheiden, weil diese Unterscheidung bislang selten nötig war. Wer flüssig sprach, hatte in der Regel auch Substanz. Diese Faustregel gilt nicht mehr automatisch.
Denken Sie an die letzte Ausschreibung, die Ihr Haus bewertet hat. Drei Angebote, alle sprachlich einwandfrei, alle mit ähnlichen Schlagworten versehen. Am Ende entschied vermutlich der Preis oder ein Bauchgefühl – nicht, weil die Fachjury unfähig gewesen wäre, sondern weil das schriftliche Angebot allein diese Tiefe gar nicht zeigen kann, die im Saarbrücker Hörsaal erst die zweite Frage offenlegte.
Besonders in KMU und im öffentlichen Dienst trifft das einen wunden Punkt: knappe Zeit für Auswahlprozesse, wenige Ressourcen für ausführliche Prüfverfahren, hoher Vertrauensvorschuss gegenüber externen Zulieferern und internen Vorlagen. Dort entsteht der größte Spielraum für eine Präsentation, die überzeugend klingt und inhaltlich hohl bleibt.
Die gute Nachricht: Was die Studierenden in Saarbrücken instinktiv richtig gemacht haben, lässt sich lernen und gezielt einsetzen – in jedem Bewerbungsgespräch, jedem Projektreview, jeder Trainingsabnahme.
Wir stehen öfter selbst am Rednerpult, als uns bewusst ist
Bevor wir uns zu schnell auf die Seite der Prüfenden stellen: Auch wir greifen längst zu KI-Werkzeugen, wenn wir Berichte schreiben, Angebote formulieren oder Vorträge vorbereiten. Das ist keine Schwäche. Es ist der vernünftige Umgang mit einem Werkzeug, das Zeit spart und die Sprache glättet.
Die Frage ist nur: Würden wir selbst der zweiten Nachfrage standhalten? Könnten wir das Kernargument unseres eigenen, KI-gestützten Berichts in einfachen Worten erklären, ohne auf die Formulierungen der Maschine zurückzugreifen? Kennen wir die Schwachstelle unserer eigenen These, oder haben wir sie nie geprüft, weil der Text schon so überzeugend klang?
Diese Selbstprüfung gehört zur gleichen Disziplin wie die Prüfung anderer. Wer von seinem Team verlangt, Substanz statt Show zu liefern, sollte den eigenen Berichten dieselbe Frage stellen, bevor sie den Schreibtisch verlassen. Genau das unterscheidet einen Werkzeugeinsatz, der uns stärker macht, von einem, der nur schneller wirkt.
Drei Fragen, die Tempo von Tiefe trennen
Wir müssen niemanden misstrauisch verhören, um Substanz zu prüfen. Drei Fragetypen reichen fast immer aus.
Erstens: Bitten Sie um eine Erklärung in einfacheren Worten, gerichtet an eine Person ohne Fachwissen. Wer eine Sache verstanden hat, kann sie herunterbrechen, ohne die Substanz zu verlieren. Wer nur Formulierungen übernommen hat, wiederholt dieselben Fachbegriffe, nur langsamer. Ein Bewerber, der sein Kalkulationsmodell nur in Fachbegriffen erklären kann, hat es womöglich abgelesen. Ein Bewerber, der es einer neuen Kollegin in drei Sätzen verständlich macht, hat es verstanden.
Zweitens: Fragen Sie nach der Grenze der eigenen These oder dem stärksten Gegenargument. Echtes Wissen kennt seine eigenen Schwachstellen. Eine reine Textwiedergabe kennt sie nicht, weil sie nie mit ihnen gerungen hat. Wer bei einem neuen Weiterbildungskonzept sofort benennen kann, wo es an Grenzen stößt, zeigt damit mehr Kompetenz als jede glatte Erfolgsgeschichte.
Drittens: Fragen Sie nach der konkreten nächsten Konsequenz, heute, in dieser Woche, an diesem Arbeitsplatz. Konzepte, die zu Ende gedacht sind, führen zu einem greifbaren nächsten Schritt. Konzepte, die nur klingen, enden in einer weiteren allgemeinen Aussage. „Wir verankern das in der Unternehmenskultur“ ist keine Antwort. „Wir starten am Montag mit einem zehnminütigen Testlauf im Team X“ ist eine.
Dieser Drei-Fragen-Test kostet in jedem Gespräch keine drei Minuten zusätzlich. Er verändert aber, wen wir einstellen, wem wir ein Projekt anvertrauen und welches Trainingskonzept wir tatsächlich buchen. Er macht aus einem diffusen Bauchgefühl eine überprüfbare Beobachtung.
Und er tut noch etwas, das wir nicht unterschätzen sollten: Er macht sichtbar, wer in Ihrem Team etwas kann, sich aber weniger geschickt verkauft als andere. Tiefe zu prüfen bedeutet nicht nur, geliehenes Wissen zu entlarven. Es bedeutet, echte Substanz endlich sichtbar zu machen.
Der Saarbrücker Vortrag war ein Selbstexperiment mit Ansage, am Ende aufgelöst, mit Lachen im Saal. In Ihrem Arbeitsalltag gibt es diese Auflösung nicht automatisch. Sie müssen sie selbst herbeiführen, durch die richtige zweite Frage, zur richtigen Zeit, an der richtigen Stelle.
Noch wirksamer wird der Drei-Fragen-Test, wenn er nicht bei Ihnen allein bleibt. Geben Sie ihn an Ihr Führungsteam weiter, üben Sie ihn gemeinsam in der nächsten Personalrunde. Aus einer persönlichen Gewohnheit wird so eine Lernkultur, die Substanz erkennt, bevor eine Fehlentscheidung daraus wird.
Fangen Sie diese Woche an. Nehmen Sie sich Ihr nächstes Bewerbungsgespräch, Ihren nächsten Projektreview oder Ihre nächste Trainingsabnahme vor und stellen Sie bewusst eine der drei Fragen. Sie müssen dafür keine KI-Expertin, kein KI-Experte werden, aber sie müssen nur eine Frage mehr stellen als bisher. Sie werden merken: Diese Fähigkeit lässt sich trainieren wie jede andere Führungskompetenz auch.
Aus über 40 Jahren Praxis weiß ich – Werkzeuge wie dieses funktionieren nicht, weil sie klug klingen, sondern weil sie im nächsten Gespräch tatsächlich angewendet werden. Schreiben Sie mir gern, ich freue mich auf den Austausch.
Sven Neuenfeldt

Schreibe einen Kommentar