中文

基于仿射变换的多任务微调方法 DiTASK

计算机视觉与模式识别 2025-06-03 v3

摘要

预训练的视觉转换器现在已成为计算机视觉的强大工具。然而,高效地将其适用于多个任务仍是一个挑战,这源于需要修改由学习权重矩阵所编码的丰富隐藏表示,而又不致于在任务之间产生干扰。当前的参数高效方法如 LoRA,它们应用低秩更新,迫使任务在受限的子空间中竞争,最终降低性能。我们引入DiTASK,这是一种新型仿射多任务微调方法,通过保持权重矩阵奇异向量来维持预训练表示的同时,通过神经仿射变换的奇异值来实现任务特定的适应。通过遵循此方法,DiTASK能够以最小的额外参数实现共享和任务特定的特征调制。我们的理论分析表明,DiTASK在优化期间实现完整秩更新,保留了预训练特征的几何结构,建立了一种高效多任务学习(MTL)的新范式。我们的实验在PASCAL MTL和NYUD上表明,DiTASK在四个密集预测任务上实现了最先进的性能,使用的 参数数量比现有方法少75%。我们的代码可在[此处](https://github.com/ipsitmantri/DiTASK)获得。

关键词

引用

@article{arxiv.2502.06029,
  title  = {DiTASK: Multi-Task Fine-Tuning with Diffeomorphic Transformations},
  author = {Krishna Sri Ipsit Mantri and Carola-Bibiane Schönlieb and Bruno Ribeiro and Chaim Baskin and Moshe Eliasof},
  journal= {arXiv preprint arXiv:2502.06029},
  year   = {2025}
}

备注

CVPR 2025, 14 pages