打破习惯:优势函数在学习因果状态表示中的作用
机器学习
2025-06-16 v1 人工智能
摘要
近期研究表明,强化学习智能体可以发展出利用奖励与观测之间虚假相关的策略。这种现象称为策略混淆,源于智能体的策略同时影响过去和未来的观测变量,形成一个反馈回路,阻碍智能体在其常规轨迹之外泛化的能力。在本文中,我们证明优势函数——策略梯度方法中常用的一种函数——不仅降低了梯度估计的方差,还缓解了策略混淆的影响。通过相对于状态表示调整动作值,优势函数降低了在当前策略下更可能出现的状态-动作对的权重,打破了虚假相关,鼓励智能体关注因果因素。我们提供了分析和实证两方面的证据,表明使用优势函数进行训练能够改善轨迹外性能。
引用
@article{arxiv.2506.11912,
title = {Breaking Habits: On the Role of the Advantage Function in Learning Causal State Representations},
author = {Miguel Suau},
journal= {arXiv preprint arXiv:2506.11912},
year = {2025}
}