用于 TextCaps 的置信感知非重复多模态 Transformer
计算机视觉与模式识别
2021-03-23 v3 计算与语言
摘要
在描述图像时,阅读视觉场景中的文本对于理解关键信息至关重要。近期工作探索了 TextCaps 任务,即带光学字符识别(OCR)词元阅读的图像描述,要求模型读取文本并将其涵盖在生成的描述之中。现有方法由于以下原因无法生成准确描述:(1)阅读能力弱;(2)无法在所有提取的 OCR 词元中挑选关键词语;(3)预测描述中词语重复。为此,我们提出一种置信感知非重复多模态 Transformer(CNMT)以应对上述挑战。我们的 CNMT 由阅读、推理和生成三个模块组成,其中阅读模块采用更优的 OCR 系统以增强文本阅读能力,并引入置信度嵌入以筛选最值得关注的词元。为解决描述中词语冗余问题,我们的生成模块包含重复掩码以避免预测重复词语。我们的模型在 TextCaps 数据集上优于 SOTA 模型,CIDEr 指标从 81.0 提升至 93.0。我们的源代码已公开可用。
引用
@article{arxiv.2012.03662,
title = {Confidence-aware Non-repetitive Multimodal Transformers for TextCaps},
author = {Zhaokai Wang and Renda Bao and Qi Wu and Si Liu},
journal= {arXiv preprint arXiv:2012.03662},
year = {2021}
}
备注
9 pages; Accepted by AAAI 2021