中文

多任务 Transformer 模型的高效跨任务注意力

计算机视觉与模式识别 2025-08-07 v1

摘要

在计算机视觉以及更广泛的深度学习领域,Transformer 架构已成为许多应用的领先技术。然而,在多任务学习中,由于可能需要比单任务模型更多的查询,其多头注意力(Multi-Head-Attention)常常接近计算可行性的限制,这是由于注意力矩阵随任务数量的平方增长(假设所有任务的查询数大致相等)。为了解决这一问题,我们提出了一种 novel Deformable Inter-Task Self-Attention 用于多任务模型,使不同任务特征图之间信息的聚合更加高效。我们在 NYUD-v2 和 PASCAL-Context 数据集上的实验表明,该方法在两种 FLOPs 计数和推理延迟上都实现了数量级的减少。同时,我们也实现了最高可达 7.4% 的提升,显著提高了各个任务的预测质量指标。

关键词

引用

@article{arxiv.2508.04422,
  title  = {Efficient Inter-Task Attention for Multitask Transformer Models},
  author = {Christian Bohn and Thomas Kurbiel and Klaus Friedrichs and Hasan Tercan and Tobias Meisen},
  journal= {arXiv preprint arXiv:2508.04422},
  year   = {2025}
}

备注

Accepted to ICONIP 2025