多任务 Transformer 模型的高效跨任务注意力
计算机视觉与模式识别
2025-08-07 v1
摘要
在计算机视觉以及更广泛的深度学习领域,Transformer 架构已成为许多应用的领先技术。然而,在多任务学习中,由于可能需要比单任务模型更多的查询,其多头注意力(Multi-Head-Attention)常常接近计算可行性的限制,这是由于注意力矩阵随任务数量的平方增长(假设所有任务的查询数大致相等)。为了解决这一问题,我们提出了一种 novel Deformable Inter-Task Self-Attention 用于多任务模型,使不同任务特征图之间信息的聚合更加高效。我们在 NYUD-v2 和 PASCAL-Context 数据集上的实验表明,该方法在两种 FLOPs 计数和推理延迟上都实现了数量级的减少。同时,我们也实现了最高可达 7.4% 的提升,显著提高了各个任务的预测质量指标。
关键词
引用
@article{arxiv.2508.04422,
title = {Efficient Inter-Task Attention for Multitask Transformer Models},
author = {Christian Bohn and Thomas Kurbiel and Klaus Friedrichs and Hasan Tercan and Tobias Meisen},
journal= {arXiv preprint arXiv:2508.04422},
year = {2025}
}
备注
Accepted to ICONIP 2025