中文

基于流动锚定噪声条件 Q 学习的高效且具表达力的离线强化学习

机器学习 2026-05-29 v2 机器人学

摘要

我们提出了 Flow-Anchored Noise-conditioned Q-Learning (FAN),一种高效且表现优异的离线强化学习 (RL) 算法。最近的研究表明,具表达力的流动策略和分布式批评家可提升离线 RL 性能,但计算成本较高。具体而言,流动策略需要迭代抽样才能产生单个动作,分布式批评家需要在多个抽样上进行计算(例如分位值)来估计价值。为解决这些效率问题同时保持高性能,我们引入 FAN。我们的方法采用行为正则化技术,仅需一次流动策略迭代,即可使用单个高斯噪声抽样来完成分布式批评家。我们对收敛性和性能界限进行了理论分析,表明这些简化不仅提升了效率,也导致更优的任务性能。在机器人操控和 locomotion 任务上的实验表明,FAN 在实现最佳性能的同时,显著降低了训练和推理运行时间。我们已在 https://github.com/brianlsy98/FAN 上发布代码。

关键词

引用

@article{arxiv.2605.01663,
  title  = {Towards Efficient and Expressive Offline RL via Flow-Anchored Noise-conditioned Q-Learning},
  author = {Sungyoung Lee and Dohyeong Kim and Eshan Balachandar and Zelal Su Mustafaoglu and Keshav Pingali},
  journal= {arXiv preprint arXiv:2605.01663},
  year   = {2026}
}

备注

ICML 2026