Ist es nur ein harmloser Leberfleck oder sollte man dringend handeln? Die Antwort liefert der Blick auf den Computerbildschirm: Dort zeigt ein Programm auf Basis von Künstlicher Intelligenz auffällige Hautveränderungen an, die sich der Hautarzt genauer ansehen sollte. Die menschliche medizinische Expertise bleibt dabei weiterhin die Grundlage für die Diagnose. Im persönlichen Gespräch wird der weitere Behandlungsfahrplan erörtert – zwischen Arzt und Patient herrscht seit jeher ein besonderes Vertrauensverhältnis. Was passiert aber in so einem Fall, wenn KI immer stärker in die Diagnose involviert ist? „Es gibt sowohl Vertrauen zwischen Arzt und Patient als auch ein Vertrauen in die verwendete Technologie“, sagt Joachim Bürkle, Geschäftsführer des AI Quality & Testing Hub (AIQ), mit dem der VDE und das Land Hessen als Gesellschafter zuverlässige Qualitätsprüfungen für KI-Systeme entwickelt.
Das Beispiel aus der Hautarztpraxis zeigt, wie nah KI inzwischen am Alltag vieler Menschen ist. Die Technologie wirkt längst „unsichtbar“ in kritischen Infrastrukturen, Fahrzeugen oder Assistenzsystemen – und damit in sicherheitsrelevanten Bereichen. „Vertrauen in KI ist zentral, weil KI inzwischen in allen Lebensbereichen Einzug gehalten hat“, weiß Joachim Bürkle.
Vertrauen ist aber nicht gleich Vertrauen: Martin Schneider, Gruppenleiter Testen am Fraunhofer-Institut für Offene Kommunikationssysteme FOKUS unterscheidet zwischen der Vertrauenswürdigkeit der KI und dem Vertrauen, das Nutzerinnen und Nutzer den Technologien entgegenbringen. Die Vertrauenswürdigkeit hängt vor allem mit verschiedenen Qualitätsparametern zusammen, dazu zählen Robustheit, Sicherheit, Transparenz und Erklärbarkeit. „Die Erklärbarkeit ist für die Vertrauenswürdigkeit sehr wichtig“, erläutert er und spricht das Schlagwort „Explainable AI“ an. Darunter versteht man Ansätze, die Entscheidungswege von KI nachvollziehbar, überprüfbar und kontrollierbar zu machen. Programme arbeiteten früher weitgehend deterministisch. Bei KI steht hingegen die sogenannte Blackbox häufig in der Kritik, nicht zuletzt aufgrund von Fehlern oder Halluzinationen.
Um Licht in das Dunkel der Blackbox zu bringen, existieren verschiedene Ansätze. Vielversprechend sind unter anderem das LIME- und SHAP-Verfahren. Vereinfacht gesagt zeigt LIME – die Abkürzung steht für „Local Interpretable Model Agnostic Explanations“ – an, welche Faktoren Einfluss auf das Ergebnis hatten. So zum Beispiel in unserer Hautarztpraxis: Dort würde LIME zeigen, welche Bildpunkte auf dem Kamerabild dafür verantwortlich waren, dass die Stelle als auffällig gekennzeichnet wurde. Das „Shapley-Additive-Explanations-Modell“ SHAP geht noch weiter und berechnet, welchen Anteil eine bestimmte Information an einer KI-Entscheidung hatte. „Man variiert die Eingabe, um herauszufinden, was genau eine Rolle gespielt haben könnte“, sagt Martin Schneider. Solche Ansätze schaffen die technischen Voraussetzungen dafür, die Entscheidungswege nachvollziehbarer zu machen – und bilden damit die Grundlage für die Regelungen des EU AI Acts.
Mit der Verordnung hat die Europäische Union eine Vorreiterrolle eingenommen. Sie stellt Regeln für den Umgang mit KI auf und setzt dabei auf einen vierstufigen risikobasierten Ansatz. Je höher das Risiko wird, desto strenger sind auch die Regeln. „In Hochrisikobereichen spielt das Thema Vertrauen eine größere Rolle“, erklärt Joachim Bürkle. Als hochriskant definiert der AI Act den Einsatz von Systemen etwa in kritischen Infrastrukturen, im Bildungssektor oder in der Justiz.
Die KI in den Sandkasten setzen, aber richtig
Wie schnell das Vertrauen in KI ohne diese Regularien an Grenzen stoßen kann, hat der Cyberangriff eines KI-Modells von OpenAI auf die Plattform Hugging Face im Juli gezeigt. In der Annahme, es gebe bei Hugging Face entsprechende Daten für die Lösung des Branchen-Tests ExploitGym zu finden, verschaffte sich das Modell den Zugang zu den Firmendaten. Im Normalfall werden solche KI-Modelle mit dem sogenannten Sandboxing in einer isolierten Umgebung getestet. Der KI sei es laut Experte Schneider gelungen, aus der Sandbox auszubrechen. Er sieht ein Versagen bei den Verantwortlichen: „Da liegt eine Schwäche bei den Rahmenbedingungen des KI-Modells vor.“ Man hätte der KI beibringen müssen, was sie dürfe – und auch, was nicht. Der Forscher empfiehlt zusätzlich zum Sandboxing sogenannte Guardrails. „Man beschränkt dabei die Freiheitsgrade, die das Modell hat.“ Genau das ist beim Hugging-Face-Angriff nicht ausreichend geschehen: OpenAI soll die Schutzmechanismen sogar bewusst reduziert haben.