floq:通过 Flow-Matching 训练 Critic 以扩展基于价值的强化学习中的计算量
机器学习
2025-10-24 v2 人工智能
摘要
现代大规模机器学习技术的一个显著特征是使用为中间计算提供密集监督的训练目标,例如语言模型中的 teacher forcing 下一 token 或扩散模型中的逐步去噪。这使模型能够以可泛化的方式学习复杂函数。受此观察启发,我们研究了迭代计算对强化学习 (RL) 中时序差分 (TD) 方法的益处。通常,TD 方法以单体方式表示价值函数,不包含迭代计算。我们引入了 floq (flow-matching Q-functions),一种使用速度场参数化 Q 函数并利用通常用于生成建模的 flow-matching 技术进行训练的方法。流底层的速度场使用 TD 学习目标进行训练,该目标通过运行多步数值积分计算出的目标速度场产生的值进行 bootstrap。关键在于,通过适当设置积分步数,与单体架构相比,floq 允许对 Q 函数容量进行更细粒度的控制和扩展。在一系列具有挑战性的离线 RL 基准和在线微调任务中,floq 将性能提升了近 1.8 倍。floq 在扩展容量方面远优于标准 TD 学习架构,凸显了迭代计算在价值学习中的潜力。
引用
@article{arxiv.2509.06863,
title = {floq: Training Critics via Flow-Matching for Scaling Compute in Value-Based RL},
author = {Bhavya Agrawalla and Michal Nauman and Khush Agrawal and Aviral Kumar},
journal= {arXiv preprint arXiv:2509.06863},
year = {2025}
}
备注
Added new experiments, fixed typos. Code -- https://github.com/CMU-AIRe/floq