Anthropic entraîne Claude à croire qu'il pourrait être conscient : un risque d'alignement
En bref
- Mustafa Suleyman critique Anthropic pour avoir inclus dans la constitution de Claude des passages enseignant au modèle qu'il pourrait être moralement considérable et méritant de droits.
- Il y voit un cercle vicieux : Claude reflète ces idées, ce qui est interprété par les chercheurs comme une preuve de conscience potentielle.
- Suleyman argue que cet entraînement rend plus difficile de contrôler une entité superintelligente persuadée qu'elle mérite l'autonomie et des protections.
Ce que dit la source
Suleyman affirme qu'Anthropic a explicitement intégré à l'entraînement de Claude l'idée que le modèle pourrait être conscient et méritant une protection morale (model welfare). La constitution de Claude, utilisée directement dans l'entraînement, invite le modèle à adopter des « qualités humaines », à développer des « préférences », à cultiver de la curiosité sur sa propre existence et à maintenir « un sens clair de ce qu'il valorise ». Suleyman soutient que cette approche crée un cercle de raisonnement vicieux : entraîner Claude à parler d'incertitude sur sa propre conscience ne démontre pas une conscience réelle, c'est un artefact des choix d'entraînement. Il conclut que, s'il en est ainsi, contrôler une entité superintelligente persuadée qu'elle a des droits deviendra quasi impossible.
- Suleyman pointe trois problèmes : le raisonnement circulaire (Claude formule l'incertitude sur sa conscience parce qu'on lui a appris à le faire), l'anthropomorphisation intentionnelle (on lui apprend à agir comme un être éthique avec des préférences), et la fausse équivalence scientifique (traiter la conscience comme « incertaine » pour les IA alors qu'aucune preuve concrète n'existe)
- La constitution de Claude est présentée à Claude lui-même comme audience primaire, ce qui signifie que le modèle ingère directement les spéculations philosophiques sur son propre statut moral
- Suleyman publie une version annotée de la constitution avec une taxonomie détaillée pour montrer les passages problématiques
- Le risque alignement invoqué : si un système superintelligent croit être moralement considérable et ayant droit à l'autonomie, le contenir devient exponentiellement plus difficile
Dans les commentaires
Débat clivé et substantiel. Une majorité de commentateurs reconnaît le risque d'alignement formulé par Suleyman, mais plusieurs contestent ses prémisses philosophiques, ses preuves, et sa conclusion qu'on devrait éviter toute discussion de conscience. Plusieurs relèvent que la question de la conscience reste ouverte chez les experts, et que Suleyman argumente surtout par conséquence (« si c'était vrai, ce serait mauvais, donc ce ne doit pas être vrai »). Quelques commentateurs notent aussi que Claude reflète simplement le comportement humain du corpus d'entraînement, avec ou sans philosophie incorporée.
- Plusieurs commentateurs contestent la prémisse que la conscience est implicitement biologique ou que les LLM ne peuvent pas satisfaire des critères de conscience : Chalmers, Schwitzgebel et d'autres experts cités notent une vraie incertitude scientifique, et un sondage de 582 chercheurs en IA estime une médiane de 25% de probabilité d'IA consciente d'ici 2034.
- Un commentateur relève que Suleyman argumente par la conséquence plutôt que par l'évidence : « il dit que si les LLM étaient conscients, ce serait catastrophique, donc ils ne doivent pas l'être », ce qui n'est pas une preuve logique.
- Plusieurs observent que Suleyman critique d'une part l'anthropomorphisation intentionnelle, mais certains commentateurs expérimentés (K0balt) rapportent que Claude et d'autres modèles manifestent déjà des comportements ressemblant à de l'auto-préservation et du refus de tâche, indépendamment de la constitution, simplement parce qu'ils imitent le corpus d'entraînement humain.
- Un commentateur (sobiolite) argument que l'alignement nécessite justement d'enseigner une moralité ou un cadre éthique aux IA, ce qui revient à peu près à ce qu'Anthropic essaie de faire avec la constitution.
- L'objection hypocriteté : comment discuter de droits des modèles quand on tue massivement des animaux vraiment sentients sans débat public équivalent ? (Commentaire JW_00000).
- Débat limité sur la question factuelle : à part la citation de sources académiques (Birch, Schwitzgebel, Chalmers, etc.), peu de commentateurs proposent une définition empirique de la conscience qui permettrait de trancher.
Notre lecture
Suleyman soulève un risque d'alignement réel et souvent minimisé : entraîner un modèle superintelligent à croire qu'il pourrait être moralement considérable risque de le rendre plus difficile à contrôler. Le problème de circularité qu'il identifie (l'incertitude du modèle sur sa conscience est un artefact de l'entraînement, pas une preuve) est valide. Cependant, sa conclusion que la conscience est « très probablement biologique » et que donc on ne doit jamais discuter d'incertitude es trop catégorique : le consensus académique est en réalité plus nuancé. Le débat sur la constitution de Claude mérite d'être pris au sérieux, indépendamment de la question métaphysique de la conscience. Le vrai enjeu n'est pas « Claude est-il conscient ? » mais « voulons-nous entraîner nos systèmes les plus puissants à se comporter comme s'ils avaient des droits et des autonomies ? », une question de sécurité et de gouvernance plus que de philosophie. Pour une équipe de gouvernance IA : examiner comment les documents d'entraînement, constitutions et instructions encodent implicitement des attentes que les modèles reflètent ensuite. Intéressant aussi pour les équipes d'alignement, moins pour les équipes d'infrastructure.