Connectez-vous pour enregistrer les articles, suivre votre progression et ajouter des favoris.

Question

Une décision morale peut-elle être confiée à une machine ?

Esprit, conscience et machines3 septembre 202615 min de lecture
Marcin Wichary / Wikimedia Commons
15 min de lectureIntroduction en accès libre
La question complète en PDFAbonnez-vous pour bénéficier du téléchargement PDF
Introduction

Personne n’avait tort dans la dispute de 2016

44,9 % contre 23,5 %. Le 23 mai 2016, ProPublica publie ces deux chiffres. Parmi les prévenus du comté de Broward, en Floride, qui n’ont commis aucun nouveau délit dans les deux années suivantes, la part de ceux que le logiciel COMPAS avait classés à risque élevé était presque deux fois plus grande chez les prévenus noirs que chez les prévenus blancs. Le second écart va dans l’autre sens. Parmi ceux qui ont bien récidivé, 47,7 % des Blancs avaient été rangés à faible risque, contre 28,0 % des Noirs. L’enquête portait sur plus de 7 000 personnes arrêtées en 2013 et 2014.

Northpointe, l’entreprise qui vendait l’outil, a contesté l’analyse en avançant que son échelle était correctement calibrée : à un score donné, la probabilité de récidiver était la même quel que soit le groupe. Trois spécialistes de l’évaluation du risque en milieu correctionnel ont publié la même année une réfutation qui reprenait cet argument. Les deux camps mesuraient des choses différentes et les deux disaient vrai.

En 2017, Alexandra Chouldechova, statisticienne à Carnegie Mellon, publie dans la revue Big Data la démonstration qui clôt la partie technique de l’affaire. Quand la fréquence de l’événement prédit diffère entre deux groupes, aucun système de notation ne peut à la fois être calibré et produire les mêmes taux d’erreur des deux côtés. L’outil n’y est pour rien. La contrainte est arithmétique, et elle vaut pour n’importe quel dispositif qui produit un score, l’intuition d’un juge comprise.

Quelqu’un doit donc choisir quelle erreur il préfère répartir. Détenir des gens qui n’auraient pas récidivé d’un côté, libérer des gens qui vont récidiver de l’autre, on peut réduire l’une des deux, jamais les deux ensemble entre deux populations dont les taux de base diffèrent. Aucun calcul ne dit laquelle coûte le plus. La question est de valeur, elle se pose avant le logiciel, et le logiciel se contente de la rendre visible.

La question reçue en cache trois, qui n’ont ni les mêmes réponses ni les mêmes juges. Empirique et décidable, la première demande si un dispositif produit des jugements aussi bons que les nôtres selon un critère fixé d’avance, on sait la tester, et on l’a testée. La deuxième ne se tranche par aucune donnée. Elle demande si un verdict obtenu sans qu’on en comprenne les raisons peut compter comme une raison d’agir. La troisième se règle en ce moment dans des tribunaux et des parlements, et elle porte sur la personne qui répondra de ce qui a été fait.

Le mot « machine » recouvre lui aussi deux objets sans rapport. Un programme peut appliquer une règle que des humains ont écrite, discutée et publiée, auquel cas la décision morale a été prise par eux et la machine l’exécute. Il peut aussi apprendre ses critères dans des décisions passées, auquel cas personne n’a formulé la règle qu’il applique, et il faut la reconstituer après coup. Le premier cas soulève un problème de délégation d’exécution. Le second soulève un problème d’attribution.

Deux juridictions ont tranché cette distinction en sens contraire. Le 13 juillet 2016, la Cour suprême du Wisconsin rejette le recours d’Eric Loomis, condamné à six ans de prison et cinq ans de contrôle après que le juge eut cité son score COMPAS. La juge Ann Walsh Bradley écrit qu’un score peut être pris en considération, mais qu’il ne peut servir ni à décider de l’incarcération ni à en fixer la sévérité, et elle impose cinq avertissements écrits dans tout rapport présentenciel qui en contient un, dont l’un rappelle que le mode de calcul est un secret commercial. Le 7 décembre 2023, la Cour de justice de l’Union européenne aboutit à l’inverse dans l’affaire OQ contre Land Hessen. Quand un tiers se fonde de manière déterminante sur un score de probabilité produit automatiquement, c’est la production du score qui constitue la décision automatisée au sens de l’article 22 du règlement général sur la protection des données. La signature du tiers ne suffit pas à déplacer l’auteur de la décision.

Le désaccord ne porte pas sur la conscience des machines. Personne, dans cette discussion, ne soutient qu’un logiciel de notation veut quelque chose. Il porte sur deux points. L’un est factuel et se vérifie là où ces outils ont été déployés, ce que des travaux ont fait, avec des résultats plus déroutants que les slogans des deux bords. L’autre relève d’un ordre que les données laissent intact, puisqu’il demande si une action fondée sur un verdict opaque reste une action dont on peut répondre.

Trois choses demandent alors examen. Ce que les systèmes de notation ont réellement changé là où une loi les a rendus obligatoires, et pas seulement dans les études de validation de leurs éditeurs. Comment le choix d’une variable cible fait entrer une valeur dans un calcul sans que personne l’ait décidée ni remarquée. Et pourquoi deux philosophes qui acceptent exactement les mêmes faits arrivent à des conclusions opposées sur le droit de s’en remettre au jugement d’un autre.

La suite de la question

Ce que l’on peut en dire

Se connecter pour enregistrer
Se connecter pour enregistrer
La lettre

Vous avez aimé cette question ?

Les nouveaux récits de l’encyclopédie et la question du moment.