中文

强化学习的自适应相关加权内在奖励

机器学习 2026-03-02 v1 人工智能

摘要

我们提出ACWI(Adaptive Correlation Weighted Intrinsic),一种用于改进稀疏奖励强化学习中探索的自适应内在奖励缩放框架。不同于依赖手动调谐标量系数,往往在不同任务中导致不稳定或亚最优性能的常规方法,ACWI在线学习状态依赖的缩放系数。具体而言,ACWI引入轻量级Beta网络,通过基于编码器的架构从agent状态直接预测内在奖励权重。该缩放机制使用基于相关性的目标函数进行优化,以鼓励加权后的内在奖励与折扣未来外在回报的对齐。该表述能够实现任务自适应的探索激励,同时保持计算效率和训练稳定性。我们在MiniGrid中的稀疏奖励环境对ACWI进行评估。实验结果表明,ACWI在与固定内在奖励基线相比下,持续改善样本效率和学习稳定性,仅需最小的计算开销即可实现优异性能。

关键词

引用

@article{arxiv.2602.24081,
  title  = {Adaptive Correlation-Weighted Intrinsic Rewards for Reinforcement Learning},
  author = {Viet Bac Nguyen and Phuong Thai Nguyen},
  journal= {arXiv preprint arXiv:2602.24081},
  year   = {2026}
}