用于可扩展离线强化学习的表达性价值学习
机器学习
2025-10-10 v1 人工智能
摘要
强化学习(RL)是学习决策序列的强大范式。然而,RL 尚未在机器人学中得到充分利用,主要原因在于其缺乏可扩展性。离线 RL 提供了一种有前景的途径,通过在大型多样化数据集上训练智能体,避免在线 RL costly 的真实世界交互。将离线 RL 扩展到日益复杂的数据集需要表达性生成模型,如扩散模型和流匹配。然而,现有方法通常依赖于通过时间反向传播(BPTT),其计算代价高昂,或依赖于策略蒸馏,这会引入复合误差并限制对更大基础策略的可扩展性。在本文中,我们探讨了如何在不依赖蒸馏或通过时间反向传播的情况下开发可扩展的离线 RL 方法。我们提出了 Expressive Value Learning for Offline Reinforcement Learning(EVOR):一种可扩展的离线 RL 方法,同时整合表达性策略与表达性价值函数。EVOR 在训练期间通过流匹配学习一个最优的正则化 Q 函数。在推理阶段,EVOR 通过针对表达性价值函数的拒绝采样进行推理时策略提取,实现高效优化、正则化和可计算扩展的搜索,而无需重新训练。实验上,我们证明 EVOR 在多样化的离线 RL 任务上优于基线,展示了将表达性价值学习融入离线 RL 的好处。
引用
@article{arxiv.2510.08218,
title = {Expressive Value Learning for Scalable Offline Reinforcement Learning},
author = {Nicolas Espinosa-Dice and Kiante Brantley and Wen Sun},
journal= {arXiv preprint arXiv:2510.08218},
year = {2025}
}
备注
24 pages, 5 figures