中文

FASTER: 基于价值引导的快速强化学习采样方法

机器学习 2026-04-22 v1 人工智能

摘要

今天最具表现性的强化学习算法往往代价高昂, 因为它们使用测试时间扩展方法, 如对多个动作候选者进行采样并选择最佳者。本文提出 FASTER, 通过将动作样本的性能增益追溯到去噪过程更早的阶段, 来获取基于采样的测试时间扩展好处而又不产生计算成本的方法。我们的关键洞察是, 我们可以将多个动作候选者的去噪以及选择最佳者建模为一个马尔可夫决策过程(MDP), 目标是在去噪完成之前逐步筛选动作候选者。有了这个 MDP, 我们可以在去噪空间中学习一个策略和价值函数, 预测动作候选者在去噪过程中下游价值, 并在最大化收益的同时进行筛选。结果是一个轻量级方法, 可插拔到现有的生成式 RL 算法中。在挑战性的长时段操控任务中的在线和 batch-online RL 中, FASTER 持续改进底层策略, 并在比较方法中实现最佳整体性能。应用于预训练 VLA, FASTER 能够在大幅度减少训练和推理计算需求的同时, 实现相同性能。代码可在 https://github.com/alexanderswerdlow/faster 获取。

关键词

引用

@article{arxiv.2604.19730,
  title  = {FASTER: Value-Guided Sampling for Fast RL},
  author = {Perry Dong and Alexander Swerdlow and Dorsa Sadigh and Chelsea Finn},
  journal= {arXiv preprint arXiv:2604.19730},
  year   = {2026}
}