停止的勇气:克服深度学习强化学习中的沉没成本谬误
机器学习
2025-06-17 v1
摘要
离策略深度强化学习(RL)通常利用重放缓冲区在学习过程中重用过去的经验。当收集的数据具有信息量且与学习目标一致时,这有助于提高样本效率;当并非如此时,它会产生用数据'污染'重放缓冲区的效果,从而加剧优化挑战,此外还因浪费采样而浪费环境交互。我们认为,通过解决沉没成本谬误,可以避免采样这些无信息且浪费的转换;在深度RL的语境中,沉没成本谬误是指倾向于持续一个回合直到终止。为了解决这一问题,我们提出了learn to stop (LEAST),一种轻量级机制,基于Q值和梯度统计实现策略性提前终止回合,帮助智能体识别何时提前终止低效回合。我们证明我们的方法在多种RL算法上提高了学习效率,在MuJoCo和DeepMind Control Suite基准测试上进行了评估。
引用
@article{arxiv.2506.13672,
title = {The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning},
author = {Jiashun Liu and Johan Obando-Ceron and Pablo Samuel Castro and Aaron Courville and Ling Pan},
journal= {arXiv preprint arXiv:2506.13672},
year = {2025}
}
备注
Proceedings of the 42nd International Conference on Machine Learning (ICML 2025)