Goal Alignment : le vrai problème n’est pas que l’IA soit méchante
Le Goal Alignment (alignement des objectifs) est le domaine de recherche en intelligence artificielle qui vise à s’assurer que les buts, décisions et actions d’un modèle correspondent réellement aux intentions et aux valeurs humaines qui les sous-tendent, sans effets secondaires imprévus. Le problème fondamental est le suivant : un système d’IA optimise très précisément ce qu’on lui a explicitement spécifié comme objectif — pas nécessairement ce que l’on voulait dire en réalité, avec toutes les nuances, précautions et limites implicites qu’un humain aurait naturellement intégrées.