中文

计算机视觉中自回归解码器用于多任务的研究

计算机视觉与模式识别 2023-03-31 v1 人工智能 机器学习

摘要

近来涌现大量执行多任务且由图像编码器(通常为 ViT)与自回归解码器(通常为 Transformer)组成的计算机视觉模型。然而,此类工作大多仅呈现某一系统及其结果,遗留诸多关于此类系统的设计决策与权衡的未解问题。本工作中,我们旨在提供此类解答。我们细致考察用于多模态计算机视觉中多任务学习的自回归解码器,包括分类、图像描述、视觉问答与光学字符识别。通过广泛系统性实验,我们研究了任务与数据混合、训练与正则化超参数、条件类型与特异性、模态组合等的影响。重要的是,我们将这些与调优良好的单任务基线比较,以凸显多任务所引致代价。一关键发现是,在冻结的预训练编码器上学习的小解码器出奇有效地工作。我们称此设置为带解码器的锁定图像调优(LiT-decoder)。可将其视为通过自然语言教导解码器与预训练视觉模型交互。

关键词

引用

@article{arxiv.2303.17376,
  title  = {A Study of Autoregressive Decoders for Multi-Tasking in Computer Vision},
  author = {Lucas Beyer and Bo Wan and Gagan Madan and Filip Pavetic and Andreas Steiner and Alexander Kolesnikov and André Susano Pinto and Emanuele Bugliarello and Xiao Wang and Qihang Yu and Liang-Chieh Chen and Xiaohua Zhai},
  journal= {arXiv preprint arXiv:2303.17376},
  year   = {2023}
}