借助分布性批评家释放流政策的潜能
机器学习
2025-09-30 v1
摘要
流动政策最近作为一种强大的工具在离线和离线到在线强化学习中涌现,能够建模来自预收集数据集中发现的复杂、多模态行为。然而,这些表达性 actor 的全部潜能往往被其批评家所限制,这些批评家通常学习单个、标量的预期回报估计。为解决这一限制,我们引入了分布性流批评家 (DFC),这是一种新的批评家架构,学习完整的状态-动作回报分布。与回归到单个价值不同,DFC采用流匹配技术,将回报分布建模为从简单基分布到复杂目标回报分布的连续、灵活的转换。通过这种方式,DFC为具有表达性流动政策提供了丰富的、分布性的 Bellman 目标,从而提供了更稳定和更具信息性的学习信号。广泛的实验在 D4RL 和 OGBench 框架下表明,我们的方法在需要多模态动作分布的任务上实现了强性能,尤其在离线和离线到在线微调方面优于现有方法。
引用
@article{arxiv.2509.23087,
title = {Unleashing Flow Policies with Distributional Critics},
author = {Deshu Chen and Yuchen Liu and Zhijian Zhou and Chao Qu and Yuan Qi},
journal= {arXiv preprint arXiv:2509.23087},
year = {2025}
}