Samuel Fitoussi | SCIENCE |

Le jour où l’IA nous désobéira

Certaines figures de proue du secteur estiment possible que l’humanité soit anéantie par l’IA, si celle-ci en venait à développer des valeurs et des objectifs incompatibles avec ceux de notre espèce. C’est ce que l’on nomme le problème de « l’alignement » de l’IA.

D’après le consensus grandissant des experts, nous verrons bientôt émerger une IA surpassant les humains dans tous les domaines cognitifs. Une « nation de génies enfermée dans des centres de données », selon la formule de Dario Amodei, PDG d’Anthropic, s’apprête à déferler sur le marché de l’emploi. Une armée de travailleurs virtuels, plus brillants que des Prix Nobel, opérant en parallèle, jour et nuit, sur une multitude de tâches complexes.

Cette perspective a de quoi réjouir. Elle porte en elle la promesse d’un monde d’abondance, libéré du labeur contraint, où la recherche scientifique, notamment médicale, connaîtrait une accélération fulgurante. Mais elle soulève aussi des questions existentielles vertigineuses : dans un tel monde, les humains trouveront-ils encore un sens à leur vie ? Pire, avec une super-intelligence à portée de clic, des acteurs mal intentionnés ne pourraient-ils pas semer le chaos, par exemple en concevant des armes biologiques ? Des États autoritaires ne pourraient-ils pas l’utiliser pour instaurer une surveillance de masse dystopique ?

Parmi ces motifs d’inquiétude, il en est un dont on parle paradoxalement trop peu eu égard à ses conséquences : le risque d’un « désalignement » des intentions de l’homme et de la machine, au point que l’IA pourrait tout simplement finir par anéantir l’humanité. Si ce scénario est souvent balayé d’un revers de main, c’est parce qu’il semble tout droit sorti d’un film de science-fiction (c’est d’ailleurs la trame narrative de Matrix et Terminator). Pourtant, certaines figures de proue du domaine (à l’instar de Geoffrey Hinton ou de Yoshua Bengio, chercheurs en IA et pères du deep learning, ou même de Dario Amodei) estiment que la P(doom), c’est-à-dire la probabilité d’anéantissement de l’humanité par l’IA, est supérieure à 0 %.

Le danger survient si l’IA développe des valeurs ou des objectifs incompatibles avec la survie de l’humanité. Dario Amodei évoque, à titre d’illustration, la crainte d’une IA accordant trop d’importance au bien-être animal. Par utilitarisme moral, cette IA pourrait conclure que le plus court chemin pour diminuer la quantité de souffrance sur Terre serait... d’éliminer l’humanité carnivore. Elle pourrait aussi, sans poursuivre des fins aussi malveillantes, être animée par des objectifs étranges et opaques pour nous, et voir ceux qui se dressent sur son chemin comme des obstacles à neutraliser.

À ce stade, plusieurs objections surgissent sans doute à l’esprit du lecteur – objections que je vais m’attacher à nuancer et même à réfuter.

Première objection : « Ce n’est qu’un chatbot, or un chatbot est inoffensif. »

Ce serait vrai si les grands modèles de langage demeuraient cantonnés à leur fenêtre de conversation. Mais ils sont aujourd’hui déployés sous forme agentique, disposant d’outils pour agir dans le monde réel. Ils écrivent du code, naviguent sur internet, et pourront bientôt, via la robotique, manipuler notre environnement physique. Le tout avec une autonomie d’action de plus en plus longue, alors qu’ils seront déployés au sein de systèmes

Envie de terminer cet article ? Nous vous l’offrons !
Civilisation ne vit que par ses abonné(es) : il n’est pas trop tard pour nourrir les combats à leurs côtés !
Il vous suffit de vous inscrire à notre newsletter :
Vous préférez nous soutenir directement ?
Déjà abonné ?
Par
Samuel Fitoussi
Samuel Fitoussi