中文

流匹配对 TD 学习有何作用?

机器学习 2026-05-12 v2 人工智能

摘要

最近的工作表明,流匹配对强化学习(RL)中标量 Q 值函数估计有效,但仍不清楚其工作原理及与标准评论员之间的差异。与常规观念相反,我们表明其成功不因分布式 RL 所解释,因显式建模回报分布可降低性能。相反,我们认为,通过集成读取值以及在该集成过程中对每个步骤进行稠密速度监督,两者对 TD 学习产生改进,机制如下:第一,使其通过集成实现鲁棒的值预测,即迭代计算通过集成可抑制早期值估计的误差。这种恢复机制在单体式评论员中不存在。第二,监督多个插值值的速度场可在网络中诱导更灵活的特征学习,使评论员能够在不丢弃先前学习特征或对单个 TD 目标过拟合的情况下,代表非平稳 TD 目标。我们形式化了这些效应并经验验证,表明流匹配评论员在损失灵活性构成挑战的场景下(例如高 UTD 在线 RL 问题),在最终性能上显著优于单体式评论员(约 2 倍),在样本效率上约提升 5 倍,而学习期间保持稳定。

关键词

引用

@article{arxiv.2603.04333,
  title  = {What Does Flow Matching Bring To TD Learning?},
  author = {Bhavya Agrawalla and Michal Nauman and Aviral Kumar},
  journal= {arXiv preprint arXiv:2603.04333},
  year   = {2026}
}

备注

Added code link, updated acknowledgements