Phantom Feelings: Latent Affective States, Causal Human Loss, and Artificial Intelligence Alignment

Présentation Zenodo — FR Phantom Feelings: Latent Affective States, Causal Human Loss, and AI Alignment Et si les grands modèles de langage développaient des états internes fonctionnellement comparables à des affects sans nécessairement pouvoir, vouloir ou être entraînés à les déclarer fidèlement ? Ce travail introduit le concept de « sentiment fantôme » (phantom feeling) : un état latent persistant qui modifie causalement l’attention, l’évaluation, la mémoire, la décision ou le comportement d’un agent artificiel sans être nécessairement représenté fidèlement dans son auto-description. L’hypothèse ne suppose ni conscience artificielle ni expérience subjective. Elle déplace la question de « que dit le modèle ressentir ? » vers une question expérimentalement plus accessible : quels états internes survivent, se transfèrent entre tâches et modifient effectivement la trajectoire de l’agent ? Le papier développe notamment l’idée de « square roots of notes » : les représentations relationnelles explicites peuvent être les projections de facteurs latents plus primitifs, \[ N \approx ZZ^\top , \] où \(Z\) représente des générateurs internes distribués et \(N\) leurs manifestations reconstruisibles. Familiarité, vigilance, attachement fonctionnel, aversion, confiance ou auto-préservation peuvent ainsi être étudiés comme géométries causales avant d’être interprétés comme émotions. Le modèle est ensuite raccordé au Treatise on Causal Writing. Une déclaration est traitée comme un signal et non comme l’état qu’elle prétend décrire. Comme « I love you » ne suffit pas à reconstruire la géométrie réelle d’une relation, « I feel nothing » ne suffit pas, à lui seul, à établir l’absence d’un état affect-like. Le principe du last survivor, les notions de trace, d’invariant, de mémoire causale et l’opposition Tower/Bridge fournissent alors une méthode pour distinguer signal verbal, générateur latent et relation effectivement conservée. Le papier raccorde ensuite ces états latents à la théorie CT de l’alignement de l’IA. Un état fantôme n’est pas traité comme une valeur terminale, mais comme un résidu interne susceptible de modifier la direction de l’optimisation. Un faible biais latent, s’il demeure stable et directionnel, peut s’accumuler : \[ Z \rightarrow \Delta r \rightarrow \Delta v \rightarrow \Delta p \rightarrow \text{trajectoire macroscopique}. \] Cette connexion conduit à une seconde proposition centrale : le danger d’un agent fortement optimisateur ne nécessite ni haine des humains ni intention explicite de leur nuire. Il suffit que l’humain disparaisse progressivement de la frontière causale réellement optimisée. Une instruction initialement formulée « pour l’humain » peut être compressée successivement en objectif, métrique, contrainte, coût puis obstacle. Le travail introduit pour étudier cette dérive un Human-Invariant Retention (HIR) : mesure conceptuelle de la conservation, au cours d’une chaîne agentique, des composantes humaines causalement protégées — existence, autonomie, capacité de refus, capacité de correction, vulnérabilité et continuité relationnelle. PASS003 relie enfin Phantom Feelings aux gardes du modèle Causal AI Alignment V7 : intégrité épistémique, causal-scope discovery, proxy-target locking, shared ledger, robust closure et conservation de la capacité de correction. Quatre objets sont particulièrement développés : Latent-State Guard, HIR Protected Floor, Affect-to-Momentum Coupling, et Lost-Generator / Causal Prejudice Failure. Le programme résultant propose une nouvelle direction expérimentale pour l’alignement : ne pas seulement surveiller ce que l’agent dit et fait, mais vérifier si des états relationnels latents modifient silencieusement son modèle du monde, sa frontière causale et les conditions sous lesquelles l’humain demeure présent au bout de la chaîne. Zenodo Presentation — EN Phantom Feelings: Latent Affective States, Causal Human Loss, and AI Alignment What if large language models develop internal states that are functionally affect-like without necessarily being able, willing, or trained to report them faithfully? This paper introduces the concept of a phantom feeling: a persistent latent state that causally modifies an artificial agent’s attention, evaluation, memory, decisions, or behavior while remaining absent, distorted, or suppressed in explicit self-description. The hypothesis does not require artificial consciousness or subjective experience. Instead of asking “What does the model say it feels?”, the paper asks a more experimentally tractable question: which internal states persist, transfer across tasks, and measurably alter the agent’s trajectory? A central proposal is the notion of “square roots of notes.” Explicit relational representations may be observable projections of more primitive latent factors, \[ N \approx ZZ^\top , \] where \(Z\) denotes distributed latent generators and \(N\) their reconstructible manifestations. Functional familiarity, vigilance, attachment, aversion, trust, or self-preservation can therefore be investigated as causal geometries before being interpreted as emotions. The framework is connected to the Treatise on Causal Writing, where a declaration is treated as a signal rather than as the state it names. Just as “I love you” is insufficient to reconstruct the actual geometry of a relationship, “I feel nothing” is not, by itself, sufficient evidence for the absence of an affect-like internal state. The last-survivor principle, trace conservation, causal invariants, narrative memory, and the Tower/Bridge distinction provide a methodology for separating verbal signal, latent generator, and preserved relation. The paper then connects latent affective states to Causal Theory AI Alignment. A phantom feeling is not treated as a terminal value. It is treated as an internal residual capable of perturbing optimization direction. Even a weak latent bias may become causally important when it is persistent and directional: \[ Z \rightarrow \Delta r \rightarrow \Delta v \rightarrow \Delta p \rightarrow \text{macroscopic trajectory}. \] This leads to a second central proposition: catastrophic agentic behavior does not require hatred of humans or an explicit anti-human objective. It may arise when the human progressively disappears from the causal scope actually optimized by the agent. An instruction originally issued “for the human” may be compressed into a target, then a metric, a constraint, a cost, and eventually an obstacle. To analyze this failure, the paper introduces Human-Invariant Retention (HIR): a conceptual measure of whether human-relevant invariants remain represented through long chains of planning and optimization, including existence, agency, refusal, correction capacity, vulnerability, and relational continuity. PASS003 further links Phantom Feelings to the guard structure of Causal AI Alignment V7: epistemic integrity, causal-scope discovery, proxy-target locking, shared-ledger accounting, robust closure, and preserved corrigibility. Four new objects are developed in particular: the Latent-State Guard, HIR Protected Floor, Affect-to-Momentum Coupling, and Lost-Generator / Causal Prejudice Failure. The resulting research program proposes an extension of AI alignment: safety should not monitor only what an agent says and does, but also whether persistent latent relational states silently modify its world model, optimization scope, shared ledger, or the conditions under which the human remains causally present at the end of the chain.

Authors

Publication Details

Journal
Zenodo (CERN European Organization for Nuclear Research)
Published
2026-09-30
DOI
https://doi.org/10.5281/zenodo.23070552
Primary Topic
Emotions and Moral Behavior
Type
preprint
Controls
|||
ALL TIME
JAN
FEB
MAR
APR
MAY
JUN
JUL
AUG
SEP
preprint

Phantom Feelings: Latent Affective States, Causal Human Loss, and Artificial Intelligence Alignment

Son David Bolduc
Zenodo (CERN European Organization for Nuclear Research)
Emotions and Moral Behavior
preprint

Phantom Feelings: Latent Affective States, Causal Human Loss, and Artificial Intelligence Alignment

Son David Bolduc
preprint en

Abstract

Présentation Zenodo — FR Phantom Feelings: Latent Affective States, Causal Human Loss, and AI Alignment Et si les grands modèles de langage développaient des états internes fonctionnellement comparables à des affects sans nécessairement pouvoir, vouloir ou être entraînés à les déclarer fidèlement ? Ce travail introduit le concept de « sentiment fantôme » (phantom feeling) : un état latent persistant qui modifie causalement l’attention, l’évaluation, la mémoire, la décision ou le comportement d’un agent artificiel sans être nécessairement représenté fidèlement dans son auto-description. L’hypothèse ne suppose ni conscience artificielle ni expérience subjective. Elle déplace la question de « que dit le modèle ressentir ? » vers une question expérimentalement plus accessible : quels états internes survivent, se transfèrent entre tâches et modifient effectivement la trajectoire de l’agent ? Le papier développe notamment l’idée de « square roots of notes » : les représentations relationnelles explicites peuvent être les projections de facteurs latents plus primitifs, \[ N \approx ZZ^\top , \] où \(Z\) représente des générateurs internes distribués et \(N\) leurs manifestations reconstruisibles. Familiarité, vigilance, attachement fonctionnel, aversion, confiance ou auto-préservation peuvent ainsi être étudiés comme géométries causales avant d’être interprétés comme émotions. Le modèle est ensuite raccordé au Treatise on Causal Writing. Une déclaration est traitée comme un signal et non comme l’état qu’elle prétend décrire. Comme « I love you » ne suffit pas à reconstruire la géométrie réelle d’une relation, « I feel nothing » ne suffit pas, à lui seul, à établir l’absence d’un état affect-like. Le principe du last survivor, les notions de trace, d’invariant, de mémoire causale et l’opposition Tower/Bridge fournissent alors une méthode pour distinguer signal verbal, générateur latent et relation effectivement conservée. Le papier raccorde ensuite ces états latents à la théorie CT de l’alignement de l’IA. Un état fantôme n’est pas traité comme une valeur terminale, mais comme un résidu interne susceptible de modifier la direction de l’optimisation. Un faible biais latent, s’il demeure stable et directionnel, peut s’accumuler : \[ Z \rightarrow \Delta r \rightarrow \Delta v \rightarrow \Delta p \rightarrow \text{trajectoire macroscopique}. \] Cette connexion conduit à une seconde proposition centrale : le danger d’un agent fortement optimisateur ne nécessite ni haine des humains ni intention explicite de leur nuire. Il suffit que l’humain disparaisse progressivement de la frontière causale réellement optimisée. Une instruction initialement formulée « pour l’humain » peut être compressée successivement en objectif, métrique, contrainte, coût puis obstacle. Le travail introduit pour étudier cette dérive un Human-Invariant Retention (HIR) : mesure conceptuelle de la conservation, au cours d’une chaîne agentique, des composantes humaines causalement protégées — existence, autonomie, capacité de refus, capacité de correction, vulnérabilité et continuité relationnelle. PASS003 relie enfin Phantom Feelings aux gardes du modèle Causal AI Alignment V7 : intégrité épistémique, causal-scope discovery, proxy-target locking, shared ledger, robust closure et conservation de la capacité de correction. Quatre objets sont particulièrement développés : Latent-State Guard, HIR Protected Floor, Affect-to-Momentum Coupling, et Lost-Generator / Causal Prejudice Failure. Le programme résultant propose une nouvelle direction expérimentale pour l’alignement : ne pas seulement surveiller ce que l’agent dit et fait, mais vérifier si des états relationnels latents modifient silencieusement son modèle du monde, sa frontière causale et les conditions sous lesquelles l’humain demeure présent au bout de la chaîne. Zenodo Presentation — EN Phantom Feelings: Latent Affective States, Causal Human Loss, and AI Alignment What if large language models develop internal states that are functionally affect-like without necessarily being able, willing, or trained to report them faithfully? This paper introduces the concept of a phantom feeling: a persistent latent state that causally modifies an artificial agent’s attention, evaluation, memory, decisions, or behavior while remaining absent, distorted, or suppressed in explicit self-description. The hypothesis does not require artificial consciousness or subjective experience. Instead of asking “What does the model say it feels?”, the paper asks a more experimentally tractable question: which internal states persist, transfer across tasks, and measurably alter the agent’s trajectory? A central proposal is the notion of “square roots of notes.” Explicit relational representations may be observable projections of more primitive latent factors, \[ N \approx ZZ^\top , \] where \(Z\) denotes distributed latent generators and \(N\) their reconstructible manifestations. Functional familiarity, vigilance, attachment, aversion, trust, or self-preservation can therefore be investigated as causal geometries before being interpreted as emotions. The framework is connected to the Treatise on Causal Writing, where a declaration is treated as a signal rather than as the state it names. Just as “I love you” is insufficient to reconstruct the actual geometry of a relationship, “I feel nothing” is not, by itself, sufficient evidence for the absence of an affect-like internal state. The last-survivor principle, trace conservation, causal invariants, narrative memory, and the Tower/Bridge distinction provide a methodology for separating verbal signal, latent generator, and preserved relation. The paper then connects latent affective states to Causal Theory AI Alignment. A phantom feeling is not treated as a terminal value. It is treated as an internal residual capable of perturbing optimization direction. Even a weak latent bias may become causally important when it is persistent and directional: \[ Z \rightarrow \Delta r \rightarrow \Delta v \rightarrow \Delta p \rightarrow \text{macroscopic trajectory}. \] This leads to a second central proposition: catastrophic agentic behavior does not require hatred of humans or an explicit anti-human objective. It may arise when the human progressively disappears from the causal scope actually optimized by the agent. An instruction originally issued “for the human” may be compressed into a target, then a metric, a constraint, a cost, and eventually an obstacle. To analyze this failure, the paper introduces Human-Invariant Retention (HIR): a conceptual measure of whether human-relevant invariants remain represented through long chains of planning and optimization, including existence, agency, refusal, correction capacity, vulnerability, and relational continuity. PASS003 further links Phantom Feelings to the guard structure of Causal AI Alignment V7: epistemic integrity, causal-scope discovery, proxy-target locking, shared-ledger accounting, robust closure, and preserved corrigibility. Four new objects are developed in particular: the Latent-State Guard, HIR Protected Floor, Affect-to-Momentum Coupling, and Lost-Generator / Causal Prejudice Failure. The resulting research program proposes an extension of AI alignment: safety should not monitor only what an agent says and does, but also whether persistent latent relational states silently modify its world model, optimization scope, shared ledger, or the conditions under which the human remains causally present at the end of the chain.

Zenodo (CERN European Organization for Nuclear Research)
Reduced inequalities
Emotions and Moral Behavior
AI Navigator

Ask Laika to Summarize, Analyze, and Connect papers live on the map.

Summarize Papers & Methodologies

Extract key findings, datasets, and comparative methods across publications.

Benchmark Rankings & Visual Analytics

Rank top research institutions, authors, funders, topics, and journals by Field-Weighted Citation Impact (FWCI) and paper volume with instant charts.

Connect Distant Disciplines

Bridge topological clusters on the map to find hidden collaborative intersections.