L’alignement des objectifs en IA : quand la machine fait ce qu’on lui dit, pas ce qu’on veut
L’alignement des intelligences artificielles est un champ de recherche qui vise à s’assurer qu’un système d’IA poursuit réellement les objectifs voulus par ses concepteurs, et non une version déformée ou détournée de ceux-ci. Le principe technique est simple à énoncer : on donne à l’IA une fonction objectif, une sorte de boussole numérique qui lui indique ce qu’elle doit maximiser ou minimiser, puis le système élabore et exécute le plan qu’il juge le plus efficace pour l’atteindre.