中文

在线表征学习与强化学习的斯塔克伯格耦合

机器学习 2026-01-30 v3 人工智能

摘要

深度Q学习在单一网络中共同学习表征和价值,具有特征和价值估计之间的良好共适应性。虽然这种架构取得了显著的成功,但表征学习与价值学习之间的耦合导致不稳定,因为表征必须不断适应非平稳的价值目标,而价值估计又依赖于这些移动中的表征。这进一步 compounded by high variance in bootstrapped targets, which causes bias in value estimation in off-policy methods. 我们引入Stackelberg Coupled Representation and Reinforcement Learning (SCORER),一种用于基于价值的RL的框架,将表征和Q学习视为层次游戏中的两个战略代理人。SCORER将Q函数建模为领袖,通过不那么频繁的更新来提交其策略,而感知网络(编码器)充当跟随者,更频繁地适应以学习最小化贝尔曼误差方差的表征。通过这种分工,Q函数最小化MSBE,而感知最小化其方差,从而减少偏差,with asymmetric updates allowing stable co-adaptation, unlike simultaneous parameter updates in monolithic solutions.我们的提出的SCORER框架导致一个二层优化问题,其解通过一个两时刻算法近似,创建两个玩家之间的非对称学习动力学。对DQN及其变体进行的大量实验表明,收益来自算法洞察而非模型复杂度。

关键词

引用

@article{arxiv.2508.07452,
  title  = {Stackelberg Coupling of Online Representation Learning and Reinforcement Learning},
  author = {Fernando Martinez and Tao Li and Yingdong Lu and Juntao Chen},
  journal= {arXiv preprint arXiv:2508.07452},
  year   = {2026}
}

备注

The Fourteenth International Conference on Learning Representations (ICLR 2026)