中文

因果涌现对齐假说:因果涌现与强化学习智能体的最终奖励相一致并具有预测作用

神经与进化计算 2026-05-11 v1

摘要

地球上生命的一个标志是智能体施加因果力量并成为后续事件驱动者的能力。这对所有尺度的认知都至关重要。因果涌现衡量智能体对其未来施加独特预测能力的程度,是因果力量的一个结果。事实上,最近的发现表明,生物智能体,甚至是极简智能体,在学习新记忆后其因果涌现会增加。然而,关于人工智能体的因果涌现程度如何,存在重大的知识空白。我们关注神经网络智能体的强化学习 (RL),涵盖一系列环境条件,包括不同的算法、智能体架构以及按复杂度排列的六个环境。为了保持一致性,我们计算了它们在其生命周期内潜在空间表示的因果涌现。我们使用最近提出的 {\Phi}ID 来估计因果涌现,并测试了它与学习性能的关系。我们的结果提出了因果涌现对齐假说:成功的智能体表现出的因果涌现能够在训练早期持续预测最终奖励,并且其表示动力学在大多数任务中与奖励提升相一致。这一观点表明,因果涌现可能是 RL 智能体中神经表示重组的一个此前未披露的维度,有望建立因果关系和干预措施,从而产生更好的 RL 智能体。我们的工作还强调了因果涌现与学习之间的对齐,作为生物与人工物比较的另一种方式。

关键词

引用

@article{arxiv.2605.06746,
  title  = {The Causally Emergent Alignment Hypothesis: Causal Emergence Aligns with and Predicts Final Reward in Reinforcement Learning Agents},
  author = {Federico Pigozzi and Michael Levin},
  journal= {arXiv preprint arXiv:2605.06746},
  year   = {2026}
}

备注

10 pages, 6 figures