Wenn gute Algorithmen plötzlich versagen: Wie KI-Empfehlungen auf Vermittlungsmärkten zu schlechterem Verhalten führen können
Die Wahl der richtigen Schule für das eigene Kind, die Suche nach dem perfekten Job oder sogar die Suche nach der idealen Gemeinde, in der sich ein neu angekommener Flüchtling niederlassen kann, sind lebensverändernde und zugleich schwierige Entscheidungen. Wo Menschen früher ihre Entscheidungen auf der Grundlage von Erfahrungen, Ratschlägen oder Broschüren trafen, können sie heute auf Tools der künstlichen Intelligenz (KI) zurückgreifen. Diese Tools können anhand historischer Daten vorhersagen, wo ein Schüler oder Mitarbeiter erfolgreich sein könnte. Auf dem Papier helfen genaue Vorhersagen den Menschen, bessere Entscheidungen zu treffen. Aber führen sie im Laufe der Jahre auch zu besseren Ergebnissen?
Wie sich herausstellt, nicht immer. Das Problem ist, dass Institutionen motiviert sein können, ihr Verhalten zu ändern, um diese Vorhersagen zu beeinflussen – selbst wenn solche Massnahmen letztendlich sowohl den Institutionen als auch ihren Mitarbeitern schaden können. Meine aktuelle Studie (zusammen mit Yuhao Du, Kenneth Joseph und Anikó Hannák) hat untersucht, wie und warum dies geschehen kann, wobei die Platzierung von Schülern an weiterführenden Schulen als Beispiel herangezogen wurde.
Veränderung von Vorhersagen durch adversarielle Interaktionen
Stellen wir uns ein System vor, in dem die Schulzuweisungen von zentralen Planern auf der Grundlage der von den Schülern angegebenen Präferenzen festgelegt werden. (Ähnliche zentralisierte Vermittlungsmechanismen werden auch in anderen Kontexten eingesetzt, beispielsweise bei der Unterbringung von Flüchtlingen in bestimmten Bundesländern oder Kantonen entsprechend ihrer prognostizierten Beschäftigungswahrscheinlichkeit.)
Schüler können einen KI-Empfehlungsdienst nutzen, um ihre bevorzugten Optionen zu ermitteln, wobei die KI die Leistungen früherer Schüler an allen Schulen berücksichtigt. Wenn Schüler mit schwachen Mathematikkenntnissen an der Schule A gute Leistungen erbracht haben, wird die KI solchen Schülern im folgenden Jahr die Schule A empfehlen. Folgen diese Schüler den Empfehlungen der KI, werden die Planer feststellen, dass die Schule A von vielen Schülern mit schwachen Mathematikkenntnissen bevorzugt wird.
Schule A kann die Vorhersagen jedoch durch ein anderes Vorgehen beeinflussen. Stellen Sie sich vor, die Schule möchte in den kommenden Jahren mehr Schüler mit starken Mathematikkenntnissen anziehen – vielleicht, weil sie zwar über gute Programme zur Unterstützung von Schülern mit schwächeren Grundlagen verfügt, diese jedoch kostspielig und zeitaufwendig sind. Indem Schule A ihren derzeitigen Schülern mit schwächeren Voraussetzungen ein wenig akademische Unterstützung oder Mittel für ausserschulische Aktivitäten vorenthält, kann sie erreichen, dass die KI sie für solche Schüler als weniger attraktiv einstuft, was letztendlich dazu führt, dass im nächsten Schuljahr weniger Empfehlungen an ähnliche Schüler ausgesprochen werden. Auf diese Weise kann Schule A mit den von ihr bevorzugten Schülerprofilen zusammengebracht werden.
Schulen können also ihr Verhalten ändern, um zukünftige Vorhersagen zu beeinflussen. Dies bezeichnen wir als „Adversarial Interaction Attack“ (Angriff durch adversarielle Interaktion).
Höhere Genauigkeit bedeutet höheres Risiko
Bei der Entwicklung von KI-Systemen streben Ingenieure oft eine hohe Genauigkeit an – das bedeutet, dass die Vorhersagen des Systems so nah wie möglich an den tatsächlich beobachteten Ergebnissen liegen sollten. Intuitiv ist dies hilfreich. Wenn die KI einem Schüler sagt, dass Schule A ihn auf ein hervorragendes Ergebnis in seiner Abschlussprüfung vorbereiten wird, und sich dies als wahr herausstellt, kann dieser Schüler auf der Grundlage des Ratschlags der KI fundierte Entscheidungen treffen. Es bedeutet auch, dass der Schüler den Empfehlungen, die er erhält, vertrauen kann.
Die Genauigkeit wird jedoch anhand dessen gemessen, was die KI beobachtet. Ist das System genau, wird jede Veränderung im Verhalten einer Schule ebenfalls schnell von der KI erfasst. Wenn die Schüler der KI vertrauen, spiegeln sich die Empfehlungen zudem in den von den Schülern geäusserten Präferenzen wider. Wird die KI als unzuverlässig angesehen, hört ihr ohnehin niemand zu, sodass es sich für die Schulen nicht lohnt, sie auszutricksen.
Das oben Gesagte erklärt ein Ergebnis, das zunächst überraschend klingen mag: Wenn die KI genauere und vertrauenswürdigere Vorhersagen trifft, haben Institutionen einen grösseren Anreiz, adversarielle Interaktionen durchzuführen.
Wie wirkt sich das auf die Fairness aus?
In unserem Beispiel bedeutet dies, dass Schulen weniger Ressourcen in die Vorbereitung der Schüler investieren. Doch nicht alle Schüler sind gleichermassen betroffen. Unsere Analyse legt nahe, dass Schüler, die mehr Unterstützung benötigen, stärkere Einbussen bei ihren Leistungen hinnehmen müssten. Bedenkt man, dass ihr Unterstützungsbedarf möglicherweise allein darauf zurückzuführen ist, dass sie in der Vergangenheit weniger Chancen hatten, können KI-Empfehlungen Ungleichheiten verschärfen – unabhängig vom Potenzial des Einzelnen.
Bedeutet dies, dass wir ergebnisorientierte Empfehlungen aufgeben und zur alten Vorgehensweise zurückkehren sollten? Das ist nicht die einzige Option. Die wichtigste Erkenntnis ist, dass wir Matching-Mechanismen (den Prozess der Zuweisung von Schulplätzen an Schüler) und KI-Systeme nicht länger isoliert voneinander gestalten sollten. Traditionell entwerfen und analysieren Ingenieure und Informatiker die KI-Empfehlungssysteme, während Ökonomen oder Verwaltungsfachleute sich um die Zuordnungsmechanismen kümmern. Bei einer isolierten Betrachtung übersehen wir jedoch die Rückkopplungsschleife, in der strategische Massnahmen darauf abzielen können, KI-Vorhersagen zu verschieben, um andere zukünftige Zuordnungen zu erreichen.
Es gibt alternative Lösungen . Beispielsweise können wir die Genauigkeit unseres Vorhersagemodells bewusst geringer halten, um Interaktionsangriffe zu verhindern. Alternativ können wir Mechanismen wählen, die es Institutionen ermöglichen, ihre wahren Präferenzen uneingeschränkt zum Ausdruck zu bringen, und diese Präferenzen berücksichtigen.
Die Lösung des Problems erfordert eine breitere Perspektive
Ich untersuche derzeit noch weitere Interventionsmöglichkeiten und Anwendungsbereiche, wobei ich ein besonderes Augenmerk auf soziale Gerechtigkeit lege. In einem gemeinsamen Projekt der ETH Zürich und der Technischen Universität Eindhoven in den Niederlanden, in Zusammenarbeit mit Kai Zhang, Sophia Lahrech, Florian Dörfler, Giulia de Pasquale und Valentina Breschi, beschäftigen wir uns mit dem Problem der Zuweisung von Flüchtlingen. In diesem Fall wählt der Sozialplaner Zuordnungen aus, die die Integration von Flüchtlingen maximieren, wie von KI-Modellen vorhergesagt. Unsere vorläufigen Ergebnisse deuten jedoch darauf hin, dass Standorte, denen Flüchtlinge zugewiesen werden, das System durch gegnerische Interaktionen manipulieren könnten, die die Beschäftigung von Flüchtlingen verzögern – genau wie im Beispiel der Schulwahl.
Was mögliche Massnahmen angeht, haben wir gezeigt, dass ein Sozialplaner den Anreiz für adversarielle Interaktionen verringern könnte, indem er begrenzt, wie stark sich ein KI-Modell im Laufe der Zeit verändern darf. (Dies ähnelt der Lösung im Rahmen der Schulwahl, bei der ein gewisses Mass an Rauschen in den KI-Vorhersagen beibehalten wurde.)
Diese Angriffe durch adversarielle Interaktionen sind ein Beispiel dafür, was schiefgehen kann, wenn komplexe technologische Systeme in ohnehin schon komplexen sozialen Kontexten eingesetzt werden. In meiner Forschung ziele ich darauf ab, diese soziale Komplexität in die Berechnung einzubeziehen, um eine bessere Systembewertung und -gestaltung zu unterstützen. Ich nutze eine mathematische Sprache, um mehrere Bereiche in einem Modell zu vereinen: nicht nur die technischen Systeme (entwickelt in der Informatik), sondern auch das damit verbundene individuelle und kollektive menschliche Verhalten (aus Psychologie, Soziologie und Wirtschaftswissenschaften) sowie die gewünschten Systemeigenschaften (formuliert durch Ethik, Philosophie und Recht).
Indem wir all diese Perspektiven zusammenführen, können wir das soziotechnische System ganzheitlich analysieren. So ist es möglich, Systeme zu entwerfen, die nicht nur auf kurzfristige Effizienz optimiert sind, sondern auch soziale Gerechtigkeit sowie andere langfristige Ziele berücksichtigen.
Für den Schulbereich haben wir daher die in der Wirtschaftswissenschaft weit verbreiteten Schulwahlmodelle um eine KI-Komponente erweitert und mithilfe spieltheoretischer Analysen Interaktionsangriffe aufgedeckt. Anschliessend führten wir eine ähnliche Untersuchung für den Flüchtlingskontext durch und stützten uns auf Methoden aus der Optimierung und Steuerung, um robustere Entscheidungsunterstützungssysteme vorzuschlagen.
Es gibt jedoch noch so viel mehr zu untersuchen. In dem Masse, wie KI-Systeme in neue Entscheidungsprozesse integriert werden und sich weiterentwickeln, entstehen neue Schwachstellen. Was wird auf dem Arbeitsmarkt geschehen, wenn wir uns bei der Berufswahl zunehmend auf automatisierte Empfehlungen verlassen? Werden Arbeitgeber einen Anreiz haben, das System anzugreifen, und wenn ja, würden dieselben Massnahmen dann auch funktionieren? Diese Fragen bleiben für die Zukunft offen. Diese Arbeit hat uns gezeigt, dass wir eine integrierte, multidisziplinäre Analyse benötigen, um sicherzustellen, dass KI-Systeme die gesunde Entwicklung unserer Gesellschaft unterstützen – nicht nur in naher Zukunft, sondern auch langfristig.