简单并不容易:面向 TextVQA 与 TextCaps 的简单强基线
计算机视觉与模式识别
2020-12-10 v1
摘要
日常场景中出现且可被 OCR(光学字符识别)工具识别的文本包含重要信息,如街道名称、产品品牌与价格。两项任务——基于文本的视觉问答与基于文本的图像描述,作为现有视觉-语言应用的文本扩展,正迅速兴起。为解决这些问题,许多复杂的多模态编码框架(如异构图结构)正被使用。本文认为,一种简单的注意力机制无需任何花哨设计即可完成相同甚至更好的工作。在该机制下,我们简单地将 OCR 词元特征拆分为独立的视觉与语言注意力分支,并将其送入一个流行的 Transformer 解码器以生成答案或描述。令人惊讶的是,我们发现这一简单基线模型相当强——它在两个流行基准 TextVQA 与 ST-VQA 的全部三个任务上持续优于 SOTA(当前最优)模型,尽管这些 SOTA 模型使用了远为复杂的编码机制。将其迁移至基于文本的图像描述,我们也超越了 TextCaps Challenge 2020 的冠军。我们希望本工作为这两个 OCR 文本相关应用设立新基线,并启发对多模态编码器设计的新思考。代码见 https://github.com/ZephyrZhuQi/ssbaseline
引用
@article{arxiv.2012.05153,
title = {Simple is not Easy: A Simple Strong Baseline for TextVQA and TextCaps},
author = {Qi Zhu and Chenyu Gao and Peng Wang and Qi Wu},
journal= {arXiv preprint arXiv:2012.05153},
year = {2020}
}