Grenzen der künstlichen Intelligenz: Sie kann ihre Ergebnisse nicht selbst bewerten.

Erfahren Sie, warum künstliche Intelligenz ihre eigene Leistung nicht bewerten kann. Verstehen Sie die Grenzen ihrer aktuellen Fähigkeiten und die Bedeutung menschlicher Aufsicht für ihre zukünftige Entwicklung.

Die wichtigsten Dinge, die Sie wissen müssen

  • Um die Qualität der KI-Ergebnisse zu gewährleisten, muss der Testprozess unabhängig und wiederholbar sein, da generative Modelle inkonsistente Ergebnisse liefern und blinde Flecken erzeugen können, die schwer selbst zu erkennen sind.
  • Funktionale Tests reichen nicht aus, um ein gutes Benutzererlebnis zu gewährleisten; eine visuelle Überprüfung ist notwendig, um die Genauigkeit der endgültigen Schnittstellendarstellung, einschließlich Layout, Inhalt und Benutzerfreundlichkeit, zu beurteilen und sicherzustellen, dass das, was der Benutzer sieht, seinen Erwartungen entspricht.
  • Regulierte Umgebungen erfordern wiederholbare und nachvollziehbare Softwaretests, um verlässliche Nachweise für die Einhaltung der Vorschriften zu erbringen, da die Variabilität der KI-Ergebnisse zwischen aufeinanderfolgenden Durchläufen deterministische Kontrollen erforderlich macht, um festzustellen, was, wann und warum getestet wurde.

Künstliche Intelligenz verändert rasant die Art und Weise, wie Software entworfen, geschrieben und getestet wird. Entwicklungsteams können KI nun nutzen, um Code zu generieren, Testfälle zu erstellen, potenzielle Fehler zu identifizieren und wiederkehrende Aufgaben der Qualitätssicherung (QS) in einer Geschwindigkeit zu automatisieren, die vor wenigen Jahren noch unrealistisch schien.

Diese Geschwindigkeit ist von großem Wert, schafft aber gleichzeitig ein neues Problem bei der Qualitätssicherung.

Wenn dieselbe Technologie sowohl zur Softwareentwicklung als auch zur Validierung eingesetzt wird, riskieren Unternehmen einen Teufelskreis des Misstrauens . Ein KI-Modell generiert möglicherweise Code basierend auf einer bestimmten Interpretation einer Anforderung und anschließend Tests, die auf derselben Interpretation beruhen. Ist die ursprüngliche Annahme falsch, können Code und Test zwar konsistent sein, erfüllen aber dennoch nicht die Bedürfnisse der Nutzer.

Anders ausgedrückt: Künstliche Intelligenz kann ihre eigene Leistung nicht allein beurteilen. Daher ist es völlig unklug, sich auf sie zu verlassen.

Dies ist kein Argument gegen KI-gestützte Entwicklung. Fehler, Störungen und inkonsistente Ergebnisse sind zu erwartende Merkmale einer Technologie, die sich noch in der Entwicklung befindet. Ich habe selbst erlebt, wie sich diese Fehler und Störungen äußern können. Die entscheidende Frage ist, ob Unternehmen über autonome Mechanismen verfügen, um diese Fehler zu erkennen, bevor sie Kunden, Mitarbeiter oder kritische Geschäftsprozesse beeinträchtigen.

Gemeinsame Annahmen schaffen gemeinsame blinde Flecken

Herkömmliche Software-Qualitätssicherungsprozesse erkennen bereits den Wert der Trennung von Entwicklung und Test an. Diejenigen, die ein System entwickeln, kennen es in- und auswendig, doch diese Vertrautheit kann es erschweren, die zugrunde liegenden Annahmen zu hinterfragen. Unabhängige Tester betrachten dasselbe System aus einer anderen Perspektive und untersuchen nicht nur, was das Programm leisten soll, sondern auch, wie wahrscheinlich ein Fehler ist.

Das gleiche Prinzip gilt auch für künstliche Intelligenz.

Modelle, die mit ähnlichen Daten trainiert wurden, dieselben Anforderungen erhalten oder in derselben Entwicklungsumgebung laufen, können dieselben blinden Flecken aufweisen. Ein Modell, das ein Feature generiert, könnte eine unklare Anforderung, einen ungewöhnlichen Nutzerablauf oder eine gerätespezifische Randbedingung ignorieren. Ein zweites Modell, das mit dem Testen dieses Features beauftragt ist, könnte diese Auslassung dann verstärken, anstatt sie aufzudecken.

Dies wird besonders riskant, wenn KI-generierte Tests allein aufgrund ihres erfolgreichen Funktionierens als Qualitätsnachweis gelten. Ein erfolgreicher Test bestätigt lediglich, dass die Testbedingungen erfüllt waren. Er beweist nicht, dass diese Bedingungen vollständig, unabhängig oder aussagekräftig waren.

Das Ergebnis kann ein System sein, das zwar technisch konsistent, aber in der Praxis fehlerhaft ist.

Der grundlegende Widerspruch zwischen generativer KI und formaler Softwarequalitätssicherung liegt in der Reproduzierbarkeit. Moderne KI-Programmieragenten sind darauf ausgelegt, zu generieren und sich anzupassen. Das heißt, bei einem scheinbar identischen Ziel können sie unterschiedliche Schritte wählen, verschiedene Werkzeuge verwenden, den Kontext unterschiedlich interpretieren und nicht identischen Code oder Tests erzeugen.

Dies liegt nicht immer daran, dass das System bei jedem Durchlauf lernt; es ist auch eine Folge von Wahrscheinlichkeitsgenerierung, Kontextänderungen und Modellentwicklung. Diese Variabilität kann bei der Lösungsfindung äußerst hilfreich sein, widerspricht aber einem Grundprinzip der Qualitätssicherung. Ein kontrollierter Test sollte nämlich mit derselben Version, unter denselben Bedingungen und mit klar definierten erwarteten Ergebnissen sowie Nachweisen für Erfolg oder Misserfolg reproduzierbar sein.

Ohne diese Kontrolle verfügen Organisationen möglicherweise nur über KI-Aktivitäten anstelle echter Gewissheit und über Ergebnisse, die zwar plausibel erscheinen, aber nicht zuverlässig reproduziert, gemessen, geprüft oder verteidigt werden können.

Beruflicher Erfolg ist nicht gleichzusetzen mit Nutzererfolg.

Viele automatisierte Tests bewerten Software anhand von Code-Signalen. Sie prüfen, ob der Dienst die erwartete Antwort liefert, ob die Seite ein bestimmtes Element enthält oder ob eine Schaltfläche über einen Bezeichner oder Selektor gefunden werden kann.

Diese Tests sind wichtig, aber sie sind nicht dasselbe wie die Überprüfung der Benutzerfreundlichkeit. Ein Test kann beispielsweise das Vorhandensein einer Schaltfläche bestätigen, selbst wenn diese von einem anderen Element verdeckt wird. Er kann auch überprüfen, ob ein Feld Text enthält, ohne zu erkennen, dass dieser Text abgeschnitten, an der falschen Stelle angezeigt oder so formatiert ist, dass er unlesbar ist.

Der Test findet möglicherweise eine Liste, die zwar technisch existiert, aber auf einem kleineren Bildschirm nicht zugänglich ist. Er bestätigt unter Umständen auch den Abschluss einer Transaktion, übersieht dabei aber, dass die dem Benutzer angezeigte Bestätigung einen falschen Betrag, ein falsches Konto oder einen falschen Status enthält.

Aus Sicht des Systems mag die Software korrekt funktioniert haben. Aus Sicht des Benutzers ist sie jedoch gescheitert.

Diese Unterscheidung ist wichtig, da moderne digitale Dienste zunehmend auf komplexen Kombinationen aus Anwendungscode, Browserverhalten, Betriebssystemen, Bildschirmgrößen, Remote-Desktops, virtuellen Umgebungen und Komponenten von Drittanbietern basieren.

Jede Änderung an einer dieser Ebenen kann die Bildschirmdarstellung verändern, ohne dass ein herkömmlicher Funktionstest zwangsläufig fehlschlägt. Daher sollte der Test nicht nur die von der Plattform gemeldeten Daten untersuchen, sondern auch, was der Benutzer tatsächlich sieht und tun kann.

Warum ist die visuelle Überprüfung wichtig?

Die visuelle Überprüfung der Benutzeroberfläche bietet eine unabhängige Perspektive, da sie das dem Benutzer angezeigte Ergebnis testet und sich nicht ausschließlich auf die interne Struktur der Anwendung stützt.

Diese Unabhängigkeit ist entscheidend. Codebasiertes Testen setzt häufig Kenntnisse über das zu testende System voraus, beispielsweise Objektbezeichner, Dokumentstrukturen, Barrierefreiheitskennzeichnungen, APIs oder erwartete Datenantworten. Visuelle Verifizierung hingegen kann die finale Benutzeroberfläche so bewerten, wie sie dem Benutzer präsentiert wird, einschließlich Layout, Positionierung, Inhalt, Zustand und Benutzerfreundlichkeit in verschiedenen Umgebungen.

Die visuelle Überprüfung ist kein separater Schritt in der Softwarequalitätssicherung und ersetzt auch keine Funktions-, Integrations-, Sicherheits- oder Leistungstests. Vielmehr wird sie in allen Qualitätssicherungsabteilungen angewendet, überall dort, wo die Benutzeroberfläche entworfen, erstellt, modifiziert oder getestet wird – von einzelnen Komponenten und Unit-Tests über Integrations- und Systemtests bis hin zu Benutzerakzeptanztests.

Funktionstests bestätigen die korrekte Durchführung des Prozesses; visuelle Überprüfungen bestätigen die korrekte und konsistente Darstellung des Ergebnisses sowie dessen Nutzbarkeit. Eine zuverlässige Qualitätssicherung erfordert beides während des gesamten Entwicklungszyklus.

Dieser Bedarf wird immer deutlicher, je mehr Softwareänderungen durch künstliche Intelligenz generiert werden. KI-Tools können zwar schnell Code erzeugen, doch diese Geschwindigkeit erhöht das Volumen und die Häufigkeit der Änderungen, die Qualitätssicherungsteams bewerten müssen. Ohne eine auf die Benutzererfahrung fokussierte Qualitätssicherungsebene können Fehler schneller durch die Lieferkette sickern, als Unternehmen sie erkennen können.

Die visuelle Überprüfung dient als Schutzmaßnahme, um die Kluft zwischen technischer Umsetzung und menschlicher Erfahrung zu überbrücken.

Iteration verwandelt Automatisierung in einen zuverlässigen Leitfaden

Künstliche Intelligenz ist effektiv bei der Generierung von Ideen, Skripten und potenziellen Testszenarien. Ihre Ergebnisse können jedoch von Durchlauf zu Durchlauf variieren. Ein Modell kann dieselben Anweisungen je nach Kontext, Konfiguration oder Wahrscheinlichkeitsvariation unterschiedlich interpretieren. Diese Flexibilität kann während der Erkundung hilfreich sein, reicht aber nicht aus, um formale Qualität zu gewährleisten.

Der Test, der zur Freigabe einer Softwareversion verwendet wird, muss reproduzierbar sein. Dieselben Eingaben müssen zu denselben Aktionen, denselben Prüfpunkten und denselben Kriterien für Bestehen/Nichtbestehen führen. Die Teams müssen nachvollziehen können, was, wann und welche Anwendungsversion getestet wurde und warum das Ergebnis akzeptiert wurde.

Künstliche Intelligenz generiert effektiv Ideen, Skripte und potenzielle Testszenarien, doch generative und agentenbasierte Systeme sind nicht per se deterministisch. Ihre Ergebnisse können aufgrund probabilistischer Generierung, Befehls- und Kontextänderungen, Modellaktualisierungen, Abrufergebnissen und Entscheidungen der Agenten bei der Werkzeugauswahl und Planung ihres nächsten Vorgehens variieren. Für die Softwareentwicklung kann diese Flexibilität die Entdeckung beschleunigen. Für die formale Qualitätssicherung hingegen entsteht ein grundlegendes Kontrollproblem.

Der Test, der zur Freigabe einer Softwareversion verwendet wird, muss reproduzierbar und nachvollziehbar sein. Dieselbe Anwendungsversion, dieselben Eingaben und dieselbe Umgebung sollten dieselben definierten Verfahren, Prüfpunkte und Erfolgskriterien liefern, sodass die Teams genau nachvollziehen können, was, wann und mit welcher Version getestet wurde und warum das Ergebnis akzeptiert wurde.

Nur so lassen sich Erfolge und Misserfolge im Laufe der Zeit messen, Fehler reproduzieren und Beweise in Audits oder strukturierten Umgebungen nutzen.

Das ist der Unterschied zwischen dem Einsatz von KI zur Beschleunigung der Testerstellung und ihrer Etablierung als alleinige Instanz für das Testen. Es ist wichtig zu wissen, wann wir aufhören sollten, uns vollständig auf KI zu verlassen.

Künstliche Intelligenz kann Teams bei der Entwicklung von Testfällen, der Identifizierung von Schwachstellen und der Reduzierung des Aufwands für die Automatisierung von Routineabläufen unterstützen. Sobald Tests jedoch in den Qualitätssicherungsprozess integriert sind, müssen sie kontrolliert, ergebnisorientiert, nachvollziehbar und auditierbar sein. Die erwarteten Ergebnisse müssen klar und eindeutig definiert sein. Änderungen müssen überprüft werden. Fehler müssen reproduzierbar sein. Und Nachweise über Erfolge und Misserfolge müssen aufbewahrt werden.

Ohne diese Kontrollmechanismen weiß eine Organisation zwar, dass ein KI-System „einige Tests“ durchgeführt hat, kann aber nicht genau nachweisen, was dabei geschehen ist. Dies schafft eine schwache Grundlage für operatives Vertrauen und eine noch schwächere Grundlage für Verantwortlichkeit.

Regulierte Umgebungen erhöhen die Risiken

Die Folgen von Schnittstellenfehlern sind nicht gleichmäßig verteilt.

In Verbraucheranwendungen können inkonsistente Felder oder fehlerhafte Meldungen zu Frustration und Umsatzeinbußen führen. In Branchen wie Finanzen, Gesundheitswesen, Verteidigung oder im öffentlichen Dienst kann ein ähnlicher Fehler Zahlungsprozesse, klinische Entscheidungen, Betriebsanweisungen oder öffentliche Dienstleistungen beeinträchtigen. Eine Benutzeroberfläche, die einen falschen Status anzeigt, eine Warnung ausblendet oder veraltete Informationen präsentiert, kann weitreichende Folgen haben, die weit über den Bildschirm selbst hinausgehen.

Regulierungsbehörden müssen ihre Kontrollmechanismen erläutern und deren Wirksamkeit nachweisen können. Die bloße Feststellung, dass ein System getestet wurde, reicht nicht aus. Die Behörden müssen gegebenenfalls belegen, dass die Tests einheitlich durchgeführt, die Ergebnisse überprüft und die Software in den Einsatzumgebungen wie erwartet funktioniert hat. Die Schließung dieser Transparenzlücke ist hierfür entscheidend.

Die von künstlicher Intelligenz bereitgestellte Sicherheit, die von Testlauf zu Testlauf variiert, erschwert diese Aufgabe zusätzlich. Dasselbe gilt für Teststrategien, die sich auf interne Systemreaktionen konzentrieren und dabei die von Mitarbeitern oder Kunden genutzte Endbenutzerschnittstelle vernachlässigen.

Eine unabhängige und wiederholbare visuelle Überprüfung trägt zu einer klareren Beweiskette bei. Sie belegt nicht nur, dass die Anwendung die erwarteten Daten geliefert hat, sondern auch, dass die korrekten Informationen zum richtigen Zeitpunkt und im richtigen Format am richtigen Ort vorlagen, als eine menschliche Entscheidung oder Handlung erforderlich war.

Dies ist von entscheidender Bedeutung, insbesondere da scheinbar geringfügige Anzeigefehler das Nutzerverhalten beeinflussen können. Eine versteckte Warnung, ein falsch gesetztes Komma, eine falsche Maßeinheit oder eine veraltete Statusanzeige verhindern zwar möglicherweise nicht die Funktionsfähigkeit der Anwendung, könnten den Nutzer aber dennoch zu einer falschen Handlung verleiten.

In diesen Umgebungen ist die Benutzeroberfläche nicht nur eine dekorative Schicht, sondern ein integraler Bestandteil des operativen Steuerungssystems.

Geschwindigkeit und Kontrolle vereinen

Der optimale Ansatz besteht nicht darin, zwischen künstlicher Intelligenz und etablierten Qualitätspraktiken zu wählen, sondern darin, beiden die jeweils geeignetste Rolle zuzuweisen.

Künstliche Intelligenz kann die Entwicklung beschleunigen, die Testabdeckung erweitern und den manuellen Aufwand für die Produktionsautomatisierung reduzieren. Unabhängige Verifizierung kann die den Ergebnissen zugrunde liegenden Annahmen hinterfragen. Deterministisches Testen kann nützliche, KI-generierte Erkenntnisse in wiederholbare Kontrollen umsetzen. Visuelle Prüfungen bestätigen, dass technisch einwandfreie Software auch für den Benutzer effektiv funktioniert.

Dieses gestaffelte Modell ermöglicht es Organisationen, künstliche Intelligenz zu nutzen, ohne Produktivität mit Beweiskraft zu verwechseln.

Dieses Modell erkennt auch an, dass keine einzelne Testmethode vollständige Sicherheit bieten kann. Tests auf Codeebene können das Verhalten einzelner Komponenten bestätigen.

Integrationstests prüfen die korrekte Kommunikation zwischen Systemen. Sicherheitstests decken Schwachstellen auf. Leistungstests untersuchen das Verhalten unter Belastung. Visuelle Überprüfungen auf allen Ebenen der Benutzeroberflächenentwicklung stellen sicher, dass das Endergebnis korrekt, zugänglich und benutzerfreundlich ist.

Der Wert liegt in der Kombination dieser Methoden, nicht in der Forderung, dass eine Methode alle anderen ersetzen soll.

Mit der zunehmenden Integration von KI in die Softwareentwicklung muss die Qualitätssicherung unabhängiger werden, nicht weniger. Unternehmen sollten davon ausgehen, dass KI-generierte Software unerwartet fehlerhaft, unvollständig oder inkonsistent sein kann. Ziel ist es nicht, jeden Fehler bei der Erstellung zu eliminieren, sondern sicherzustellen, dass diese Fehler sichtbar werden, bevor sie den Benutzer erreichen. Dadurch wird die Transparenzlücke geschlossen, die Risiken im KI-Code bergen könnte.

Künstliche Intelligenz kann bei Aufgaben helfen und sogar Vorschläge zur Überprüfung unterbreiten. Die Endnote muss jedoch aus einem unabhängigen, wiederholbaren und nachvollziehbaren Qualitätssicherungsprozess resultieren.

Kommentarfunktion ist geschlossen.