控制即推断派生的时序差学习中的韦伯-费舍尔定律
机器学习
2026-02-25 v1 机器人学
摘要
本文研究了基于时序差(TD)误差的非线性更新规则。标准强化学习中,TD 误差与更新程度成线性比例, treats all rewards equally without no bias。相比之下,近期生物学研究表明,TD 误差与更新程度之间存在非线性,导致策略偏向乐观或悲观。这种由于非线性导致的学习偏差预计在生物学习中具有有用性且可被有意保留的特征。因此,本研究探索一种能够利用更新程度与 TD 误差之间非线性关系的理论框架。为此,我们关注控制即推断(control as inference)框架,因为它已知是涵盖各种强化学习和最优控制方法的通用表述。特别地,我们研究在从控制即推断推导标准强化学习时所需排除的不可计算的非线性项。通过分析,我们发现韦伯-费舍尔定律(Weber-Fechner law, WFL)即 perception(即更新程度)对刺激变化(即 TD 误差)的反应,将被刺激强度(即价值函数)的增加所削弱。为从数值上揭示 WFL 在强化学习中的实用性,我们提出了一个基于奖励-惩罚框架的实际实现方案,并修改了最优性的定义。该实现的分析表明,预期可获得两个实用性:i) 早期提高奖励至一定水平,ii) 在学习期间有效抑制惩罚。我们最终通过仿真和机器人实验检验并讨论了这些预期实用性。结果表明,带有 WFL 的所提出强化学习算法展现出加速奖励最大化启动并持续抑制惩罚的预期效用。
引用
@article{arxiv.2412.21004,
title = {Weber-Fechner Law in Temporal Difference learning derived from Control as Inference},
author = {Keiichiro Takahashi and Taisuke Kobayashi and Tomoya Yamanokuchi and Takamitsu Matsubara},
journal= {arXiv preprint arXiv:2412.21004},
year = {2026}
}
备注
36 pages 9 figures