通过价值引导流实现高维连续控制的可扩展探索
机器学习
2026-01-28 v1 机器人学
摘要
在生物和机器人应用中控制高维系统因状态-动作空间庞大而极具挑战,其中有效的探索至关重要。强化学习中常用的探索策略大多是无向的,且随动作维度增长急剧退化。许多现有方法诉诸降维,这限制了策略的表达能力并丧失了系统灵活性。我们提出 Q-guided Flow Exploration (Qflex),一种在原生高维动作空间中直接进行探索的可扩展强化学习方法。在训练期间,Qflex 沿着由学习到的价值函数诱导的概率流,从可学习的源分布遍历动作,使探索与任务相关梯度对齐,而非各向同性噪声。我们提出的方法在多种高维连续控制基准上显著优于代表性的在线强化学习基线。Qflex 还成功控制了全身人体肌骨模型以执行敏捷复杂的运动,展示了在极高维环境中卓越的可扩展性与样本效率。结果表明,价值引导流为大规模探索提供了一种有原则且实用的途径。
引用
@article{arxiv.2601.19707,
title = {Scalable Exploration for High-Dimensional Continuous Control via Value-Guided Flow},
author = {Yunyue Wei and Chenhui Zuo and Yanan Sui},
journal= {arXiv preprint arXiv:2601.19707},
year = {2026}
}
备注
Accepted by ICLR 2026