通过内省:自我意识奖励模型的探索
计算与语言
2026-01-13 v2 人工智能
机器学习
摘要
理解人工智能体如何建模内部心理状态是推进AI中的心理学理论的核心。证据指向统一的自我和他人意识系统。我们通过让强化学习智能体在网格世界环境中推断自身内部状态来探索这种自我意识。具体而言,我们引入受生物学疼痛作为学习信号启发的内省探索组件,该组件利用隐藏马尔可夫模型推断“疼痛信念”。该信号整合到主观奖励函数中,以研究自我意识对智能体学习能力的影响。进一步,我们使用该计算框架来研究正常和慢性疼痛感知模型之间的性能差异。结果表明,内省智能体总体显著优于标准基线智能体,并能够复制复杂的人类类行为。
引用
@article{arxiv.2601.03388,
title = {Metaphors are a Source of Cross-Domain Misalignment of Large Reasoning Models},
author = {Zhibo Hu and Chen Wang and Yanfeng Shu and Hye-young Paik and Liming Zhu},
journal= {arXiv preprint arXiv:2601.03388},
year = {2026}
}
备注
17 pages, 7 figures