更大、正则化、类别化:高容量值函数是高效的多任务学习者
机器学习
2025-05-30 v1
摘要
语言建模与视觉领域的最新进展源于在多样化、多任务数据上训练大型模型。这一范式在基于价值的强化学习 (RL) 中影响有限,因为该领域的改进往往由在单任务环境下训练的小模型所驱动。这是因为在多任务 RL 中,稀疏奖励与梯度冲突使得时序差分的优化变得脆弱。因此,通用策略的实用工作流避免在线训练,转而克隆专家轨迹或将单任务策略集合蒸馏到单一智能体中。在本工作中,我们表明,使用通过交叉熵训练并以可学习的任务嵌入为条件的高容量值模型,能够解决在线 RL 中的任务干扰问题,从而实现稳健且可扩展的多任务训练。我们在 7 个多任务基准上测试了我们的方法,包含超过 280 个独特任务,涵盖高自由度人形控制与基于离散视觉的 RL。我们发现,尽管方法简单,所提出的方法仍实现了最先进的单任务与多任务性能,并具备对新任务的样本高效迁移能力。
引用
@article{arxiv.2505.23150,
title = {Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners},
author = {Michal Nauman and Marek Cygan and Carmelo Sferrazza and Aviral Kumar and Pieter Abbeel},
journal= {arXiv preprint arXiv:2505.23150},
year = {2025}
}
备注
preprint