带约束初始表示的时间差分学习
机器学习
2026-02-13 v1
摘要
最近,有许多尝试旨在提高离策略强化学习(RL)智能体与环境交互时的样本效率,包括架构改进和新算法。尽管取得了这些进展,但它们忽略了直接约束输入数据初始表示的潜力,这可以直观地缓解分布偏移问题并稳定训练。在本文中,我们将 Tanh 函数引入初始层以实现这种约束。我们从理论上揭示了在线性函数逼近下使用 Tanh 函数进行时间差分学习的收敛性质。受理论见解的启发,我们提出了约束初始表示框架,标记为 CIR,它由三个组件组成:(i) Tanh 激活函数以及归一化方法以稳定表示;(ii) 跳跃连接模块,提供从浅层到深层的线性通路;(iii) 凸 Q 学习,允许更灵活的价值估计并减轻潜在的保守性。实验结果表明,CIR 在众多连续控制任务上表现出强大的性能,甚至能与现有强基线方法竞争或超越它们。
引用
@article{arxiv.2602.11800,
title = {Temporal Difference Learning with Constrained Initial Representations},
author = {Jiafei Lyu and Jingwen Yang and Zhongjian Qiao and Runze Liu and Zeyuan Liu and Deheng Ye and Zongqing Lu and Xiu Li},
journal= {arXiv preprint arXiv:2602.11800},
year = {2026}
}
备注
35 pages