AutoTaskFormer:面向多任务学习的视觉 Transformer 架构搜索
计算机视觉与模式识别
2023-04-21 v2
摘要
视觉 Transformer 在分类和分割等单任务中已展现出优异性能。然而,现实世界的问题并非孤立的,这需要能够并发执行多个任务的视觉 Transformer。现有的多任务视觉 Transformer 为手工设计,严重依赖人类专业知识。在本工作中,我们提出一种新颖的一次性神经架构搜索框架,称为 AutoTaskFormer(自动化多任务视觉 Transformer,Automated Multi-Task Vision TransFormer),以自动化该过程。AutoTaskFormer 不仅自动识别跨多个任务共享的权重,还提供数千个训练良好的视觉 Transformer,具有广泛的参数(例如头数和网络深度),以便在各种资源约束下部署。在小型(2 任务 Cityscapes 和 3 任务 NYUv2)和大型(16 任务 Taskonomy)数据集上的实验表明,AutoTaskFormer 在多任务学习中优于最先进的手动设计视觉 Transformer。全部代码与模型将开源。
引用
@article{arxiv.2304.08756,
title = {AutoTaskFormer: Searching Vision Transformers for Multi-task Learning},
author = {Yang Liu and Shen Yan and Yuge Zhang and Kan Ren and Quanlu Zhang and Zebin Ren and Deng Cai and Mi Zhang},
journal= {arXiv preprint arXiv:2304.08756},
year = {2023}
}
备注
15 pages