中文

面向离线多任务强化学习的软冲突解决决策转换器

机器学习 2025-11-18 v1 人工智能

摘要

多任务强化学习 (MTRL) 旨在学习统一的策略,但常因跨任务的梯度冲突而受阻。现有的基于掩码的方法试图通过分配任务特定的参数掩码来缓解此类冲突。然而,我们的经验研究表明,粗粒度的二值掩码存在过抑制关键冲突参数的问题,阻碍了跨任务的知识共享。此外,不同任务呈现不同的冲突程度,而现有方法使用单一的固定稀疏策略来维持训练稳定性和性能,这在实际应用中不足。上述局限性阻碍了模型的泛化和学习效率。为此,我们提出 SoCo-DT,一种基于参数重要性的软冲突解决方法。通过利用 Fisher 信息,掩码值被动态调整,以保留重要参数同时抑制冲突参数。此外,我们引入基于四分位范围 (IQR) 的动态稀疏度调整策略,该策略利用训练期间冲突和和谐得分的分布构建任务特定的阈值方案。为实现训练期间自适应稀疏度演化,我们进一步采用非对称余弦退火计划持续更新阈值。在 Meta-World 基准测试中,实验结果表明 SoCo-DT 在 MT50 上比最先进方法提高 7.6%,在次优数据集上提高 10.5%,显示其在缓解梯度冲突和提升整体多任务性能方面的有效性。

关键词

引用

@article{arxiv.2511.13133,
  title  = {Soft Conflict-Resolution Decision Transformer for Offline Multi-Task Reinforcement Learning},
  author = {Shudong Wang and Xinfei Wang and Chenhao Zhang and Shanchen Pang and Haiyuan Gui and Wenhao Ji and Xiaojian Liao},
  journal= {arXiv preprint arXiv:2511.13133},
  year   = {2025}
}