从踢腿到因果推断:基于稳健内在奖励的婴儿主体感知仿真
人工智能
2025-07-22 v1 机器人学
摘要
虽然人类婴儿能够稳健地发现自身的因果效能,但标准强化学习智能体仍显脆弱,因为其依赖基于相关性的奖励在噪声环境且符合生态学有效性的场景中难以奏效。为此,我们提出了因果动作影响得分(Causal Action Influence Score, CAIS),一种基于因果推断的新型内在奖励。CAIS 通过测量动作条件下感官结果分布 与基线结果分布 之间的 1-Wasserstein 距离,来量化该动作的影响。这种发散量提供了稳健的奖励,能够从环境噪声中隔离出智能体的因果影响。我们在模拟的婴儿摇玩具环境中进行测试,其中基于相关性的感知奖励在摇玩具受到外部力作用时完全失效。与此相反,CAIS 使智能体能够过滤噪声、识别其影响并学习正确的策略。此外,CAIS 所学得的高质量预测模型使 our agent 在加入惊讶信号后,成功复现了“消失突发”现象。我们得出结论,显式推断因果性是发展稳健主体感知能力的关键机制,为构建更具适应性的自主系统提供了心理学上可信的框架。
引用
@article{arxiv.2507.15106,
title = {From Kicking to Causality: Simulating Infant Agency Detection with a Robust Intrinsic Reward},
author = {Xia Xu and Jochen Triesch},
journal= {arXiv preprint arXiv:2507.15106},
year = {2025}
}
备注
13 pages, 5 figures