基于流动锚定噪声条件 Q 学习的高效且具表达力的离线强化学习
机器学习
2026-05-29 v2 机器人学
摘要
我们提出了 Flow-Anchored Noise-conditioned Q-Learning (FAN),一种高效且表现优异的离线强化学习 (RL) 算法。最近的研究表明,具表达力的流动策略和分布式批评家可提升离线 RL 性能,但计算成本较高。具体而言,流动策略需要迭代抽样才能产生单个动作,分布式批评家需要在多个抽样上进行计算(例如分位值)来估计价值。为解决这些效率问题同时保持高性能,我们引入 FAN。我们的方法采用行为正则化技术,仅需一次流动策略迭代,即可使用单个高斯噪声抽样来完成分布式批评家。我们对收敛性和性能界限进行了理论分析,表明这些简化不仅提升了效率,也导致更优的任务性能。在机器人操控和 locomotion 任务上的实验表明,FAN 在实现最佳性能的同时,显著降低了训练和推理运行时间。我们已在 https://github.com/brianlsy98/FAN 上发布代码。
引用
@article{arxiv.2605.01663,
title = {Towards Efficient and Expressive Offline RL via Flow-Anchored Noise-conditioned Q-Learning},
author = {Sungyoung Lee and Dohyeong Kim and Eshan Balachandar and Zelal Su Mustafaoglu and Keshav Pingali},
journal= {arXiv preprint arXiv:2605.01663},
year = {2026}
}
备注
ICML 2026