中文

UniTAB:统一文本与框输出以实现接地视觉-语言建模

计算机视觉与模式识别 2022-07-28 v2

摘要

我们提出UniTAB,其统一文本与框(Text And Box)输出以实现接地视觉-语言(VL)建模。接地VL任务如接地图像描述要求模型生成文本描述并将预测词与物体区域对齐。为实现此点,模型必须共同生成所需文本与框输出,同时指示词与框之间的对齐。与现有使用多个独立模块处理不同输出的方案相反,UniTAB以共享令牌序列表示文本与框输出,并引入特殊<obj>令牌以在序列中自然指示词-框对齐。因此,UniTAB可通过将生成词自由接地至物体区域,提供更全面且可解释的图像描述。在接地图像描述上,UniTAB以单一输出头给出了更简洁的方案,并在接地与描述评测中显著优于最先进水平。在具有不同所需输出格式(即文本、框或二者组合)的通用VL任务上,UniTAB以单一网络取得优于或可比于任务特定最先进方法的性能。实验涵盖7个VL基准,包括接地图像描述、视觉接地、图像描述与视觉问答。此外,UniTAB的统一多任务网络与任务无关输出序列设计使模型参数高效且可泛化至新任务。

关键词

引用

@article{arxiv.2111.12085,
  title  = {UniTAB: Unifying Text and Box Outputs for Grounded Vision-Language Modeling},
  author = {Zhengyuan Yang and Zhe Gan and Jianfeng Wang and Xiaowei Hu and Faisal Ahmed and Zicheng Liu and Yumao Lu and Lijuan Wang},
  journal= {arXiv preprint arXiv:2111.12085},
  year   = {2022}
}

备注

ECCV 2022 (Oral Presentation)