中文

解决词空间梯度冲突:面向基于 Transformer 的多任务学习的 Token 空间操作

机器学习 2025-07-22 v2 人工智能 计算机视觉与模式识别

摘要

多任务学习(MTL)使多个任务能在共享网络中学习,但不同任务的目标差异会导致负迁移,即一个任务的学习会损害另一个任务的性能。虽然预训练 Transformer 显著提升了 MTL 性能,但其固定的网络容量和刚性结构限制了适应性。以往的动态网络架构试图解决此问题,但效率低下,因为它们直接将共享参数转换为任务特定参数。我们提出 Dynamic Token Modulation and Expansion(DTME-MTL),这是一种适用于任何基于 Transformer 的 MTL 架构的框架。DTME-MTL 通过识别词空间中的梯度冲突并根据冲突类型应用自适应解决方案来增强适应性并减少过拟合。不同于先前通过复制网络参数来缓解负迁移的方法,DTME-MTL 完全在词空间内运作,无需额外参数增长即可实现高效适应。大量实验表明,DTME-MTL 在多任务性能方面持续实现提升,同时保持最小的计算开销,为增强基于 Transformer 的 MTL 模型提供了可扩展且高效的解决方案。

关键词

引用

@article{arxiv.2507.07485,
  title  = {Resolving Token-Space Gradient Conflicts: Token Space Manipulation for Transformer-Based Multi-Task Learning},
  author = {Wooseong Jeong and Kuk-Jin Yoon},
  journal= {arXiv preprint arXiv:2507.07485},
  year   = {2025}
}

备注

Accepted at ICCV 2025