中文

信任域Q-极迹匹配

机器学习 2026-05-27 v1 人工智能 机器人学

摘要

基于Q学习的反向匹配(QAM)方法近期用于解决预训练流动策略的离线强化学习中的优化不稳定问题,该方法通过学习的批评家将问题重新表述为无记忆随机最优控制问题。然而,QAM继承了批评家引导改进的根本脆弱性:当批评家条件不良时,小的批评家误差会被放大,常导致模型崩溃。本文引入信任域Q-极迹匹配(TRQAM),一种通过投影对偶梯度自适应控制路径空间KL散度的稳定离线微调算法。具体而言,我们优化SOC动力学中的信任域参数λ,理论证明路径空间KL可由λ的闭式函数表示。因此,该方法能够精确控制与预训练流动策略的具体偏差,实现稳定的离线强化学习。在50个OGBench任务上的实验表明,TRQAM在离线强化学习和离线到在线强化学习中均一致优于现有方法。在离线强化学习中,TRQAM实现68%的整体成功率,显著提升了最强基线的46%。

关键词

引用

@article{arxiv.2605.27079,
  title  = {Trust Region Q Adjoint Matching},
  author = {Yonghoon Dong and Kyungmin Lee and Changyeon Kim and Jaehyuk Kim and Jinwoo Shin},
  journal= {arXiv preprint arXiv:2605.27079},
  year   = {2026}
}