中文

打破习惯:优势函数在学习因果状态表示中的作用

机器学习 2025-06-16 v1 人工智能

摘要

近期研究表明,强化学习智能体可以发展出利用奖励与观测之间虚假相关的策略。这种现象称为策略混淆,源于智能体的策略同时影响过去和未来的观测变量,形成一个反馈回路,阻碍智能体在其常规轨迹之外泛化的能力。在本文中,我们证明优势函数——策略梯度方法中常用的一种函数——不仅降低了梯度估计的方差,还缓解了策略混淆的影响。通过相对于状态表示调整动作值,优势函数降低了在当前策略下更可能出现的状态-动作对的权重,打破了虚假相关,鼓励智能体关注因果因素。我们提供了分析和实证两方面的证据,表明使用优势函数进行训练能够改善轨迹外性能。

关键词

引用

@article{arxiv.2506.11912,
  title  = {Breaking Habits: On the Role of the Advantage Function in Learning Causal State Representations},
  author = {Miguel Suau},
  journal= {arXiv preprint arXiv:2506.11912},
  year   = {2025}
}