L'alignement
Comment fait-on, concrètement, pour qu'une IA poursuive réellement les objectifs voulus par ses concepteurs ? Le vocabulaire et les techniques de ce champ de recherche.
L'alignement n'est pas qu'une question philosophique abstraite (voir notre page dédiée à la superintelligence) : c'est aussi un champ de recherche technique concret, avec ses propres méthodes, déjà partiellement appliquées à l'entraînement des modèles actuels — voir notre page sur l'entraînement d'une IA pour le contexte plus large du RLHF et du post-training.
- Alignement
- L'ensemble des recherches et techniques visant à faire en sorte qu'un système d'IA poursuive réellement les objectifs voulus par ses concepteurs — et pas une version déformée ou détournée de ces objectifs, un risque documenté sur des systèmes optimisés de façon trop littérale.
- Corrigibilité (corrigibility)
- La propriété, pour un système d'IA, d'accepter d'être corrigé, modifié ou arrêté par ses opérateurs humains sans y résister activement — considérée par une partie des chercheurs en sécurité comme un objectif intermédiaire plus réaliste et vérifiable qu'un alignement parfait dès le départ.
- Interprétabilité (interpretability)
- Le champ de recherche qui vise à comprendre ce qui se passe réellement à l'intérieur d'un modèle — quels mécanismes internes produisent quelles réponses — plutôt que de le traiter comme une boîte noire dont on observe seulement les entrées et sorties. Un domaine jugé stratégique par plusieurs grands laboratoires, dont Anthropic, qui y consacre une équipe de recherche dédiée.
- Supervision extensible (scalable oversight)
- Le défi de superviser efficacement un système d'IA dont les capacités dépassent, sur certaines tâches, celles des humains chargés de l'évaluer — comment vérifier la qualité d'un travail qu'on ne serait pas soi-même capable de produire ou de comprendre entièrement ?
- IA constitutionnelle (constitutional AI)
- Une technique d'entraînement, développée par Anthropic, où un modèle apprend à critiquer et réviser ses propres réponses en fonction d'un ensemble explicite de principes écrits (une « constitution »), plutôt que de dépendre uniquement de retours humains au cas par cas — une alternative partielle au RLHF classique (voir notre page sur l'entraînement d'une IA).
- Red teaming
- Le fait de confier à des équipes dédiées la mission de trouver activement les failles d'un modèle — réponses dangereuses, biais, moyens de contourner ses garde-fous — avant son déploiement public. Une pratique désormais standard chez les grands laboratoires pour tout modèle frontière.
Voir le tableau d'ensemble
Où en est vraiment la recherche sur l'AGI et la superintelligence.
Comprendre l'AGI →