Polyhistor:面向密集视觉任务的高效参数多任务适配方法
计算机视觉与模式识别
2022-10-10 v1
摘要
通过微调将大规模预训练模型适配到各种下游任务是机器学习中的标准方法。近来,参数高效微调方法在仅训练少量参数的情况下将预训练模型适配到不同任务方面展现出前景。尽管取得了成功,现有大多数方法是在自然语言处理任务中针对语言 Transformer 提出的,而针对视觉 Transformer 的计算机视觉任务(尤其是密集视觉任务)的适配仍未被充分探索。此外,在多任务设置中,为不同任务单独微调和存储分离模型是低效的。在本工作中,我们提供了一个广泛的多任务参数高效基准,并考察了现有的自然语言处理参数高效微调方法在视觉任务上的表现。我们在四个不同密集视觉任务上的结果表明,由于分层视觉 Transformer 的层次化特性,现有方法无法被高效集成。为克服该问题,我们提出了 Polyhistor 和 Polyhistor-Lite,其由分解超网络(Decomposed HyperNetworks)与逐层缩放核(Layer-wise Scaling Kernels)组成,以使用少量可训练参数在不同任务间共享信息。这在使用更少可训练参数的情况下,相对于现有参数高效方法取得了良好的性能提升。具体而言,Polyhistor 在仅使用约 10% 可训练参数的情况下,取得了与最先进(SOTA)方法相竞争的精度。此外,当使用更大的网络和更多预训练数据时,我们的方法展现出更大的性能增益。
引用
@article{arxiv.2210.03265,
title = {Polyhistor: Parameter-Efficient Multi-Task Adaptation for Dense Vision Tasks},
author = {Yen-Cheng Liu and Chih-Yao Ma and Junjiao Tian and Zijian He and Zsolt Kira},
journal= {arXiv preprint arXiv:2210.03265},
year = {2022}
}
备注
Accepted to NeurIPS 2022; Project Page is at https://ycliu93.github.io/projects/polyhistor.html