中文

TOPPO:通过评论家平衡重新思考多任务强化学习的 PPO

人工智能 2026-05-13 v1 机器学习 机器人学 机器学习

摘要

软演员-评论家(SAC)及其变体因其异策略样本效率主导了多任务强化学习(MTRL),而同策略方法如近端策略优化(PPO)则尚未被充分探索。我们诊断出 PPO 在 MTRL 中存在一个先前被忽视的问题:评论家侧梯度病态,这可能导致尾部任务停滞,而简单任务主导价值函数的更新。为解决此问题,我们提出 TOPPO(Tail-Optimized PPO,尾部优化 PPO),通过 Critic Balancing(评论家平衡)——一组改善梯度条件并平衡跨任务学习动态的模块——对 PPO 进行重构。与依赖模块化架构或大模型的先前方法不同,TOPPO 针对 PPO 内部的优化瓶颈。实验表明,在 Meta-World+ 基准上,TOPPO 在平均性能和尾部任务性能上均优于已发表的 SAC 系列和 ARS 系列基线,同时使用的参数量和交互步数显著减少。值得注意的是,TOPPO 在训练早期就能匹敌或超越强大的 SAC 基线,并在完整预算下保持优越性能。消融实验证实了 TOPPO 中每个模块的有效性,并揭示了它们之间的相互作用。我们的结果表明,通过适当的优化,同策略方法可以在 MTRL 中匹敌或超越异策略方法,挑战了当前对 SAC 的普遍依赖,并凸显了评论家侧梯度条件作为核心瓶颈的地位。

关键词

引用

@article{arxiv.2605.11473,
  title  = {TOPPO: Rethinking PPO for Multi-Task Reinforcement Learning with Critic Balancing},
  author = {Yuanpeng Li and Gefei Lin and Annie Qu and Rui Miao},
  journal= {arXiv preprint arXiv:2605.11473},
  year   = {2026}
}