中文

通过多任务异构训练实现的高效通用模块化视觉模型

计算机视觉与模式识别 2023-06-30 v1 人工智能 机器学习

摘要

我们提出了一种可执行多种视觉任务并能高效适配其他下游任务的模型。尽管多任务学习已取得显著进展,多数努力集中于从多标签数据学习:即带有多个任务标签的单一图像集。此类多标签数据集稀少、规模小且昂贵。我们将具有不同任务标签的图像集或单任务数据集的组合称为异构数据。极少有研究探索在此类异构数据集上训练。通用视觉模型仍由单任务预训练主导,且如何利用为主流不同目的设计的视觉数据集来扩展多任务模型仍不明确。挑战在于处理视觉任务间巨大的内在差异,包括数据分布、架构、任务特定模块、数据集规模与采样策略。为应对这些挑战,我们提出改进并扩展混合专家(MoE)视觉 Transformer,使其能在 ImageNet、COCO 与 ADE20K 等多样化主流视觉数据集上同时学习分类、检测与分割。我们的方法取得了与单任务 SOTA 模型相当的结果,并在下游任务上展现出强泛化能力。由于其涌现的模块化特性,该通用模型可分解为高性能组件,高效适配下游任务。我们可用更少的训练参数、更少的模型参数与更少的计算量进行微调。此外,其模块化允许在持续学习且不遗忘的场景中轻松扩展。最后,这些功能可被控制与组合以满足下游任务的多样需求。

关键词

引用

@article{arxiv.2306.17165,
  title  = {An Efficient General-Purpose Modular Vision Model via Multi-Task Heterogeneous Training},
  author = {Zitian Chen and Mingyu Ding and Yikang Shen and Wei Zhan and Masayoshi Tomizuka and Erik Learned-Miller and Chuang Gan},
  journal= {arXiv preprint arXiv:2306.17165},
  year   = {2023}
}