问题控制的文本感知图像描述生成
计算机视觉与模式识别
2021-08-05 v1 多媒体
摘要
对于包含多个场景文本的图像,不同人可能感兴趣于不同的文本信息。当前的文本感知图像描述模型无法根据各种信息需求生成有区分度的描述。为探索如何生成个性化文本感知描述,我们定义了一项新的具有挑战性的任务,即问题控制的文本感知图像描述生成(Question-controlled Text-aware Image Captioning, Qc-TextCap)。该任务以问题作为控制信号,要求模型理解问题、找到相关场景文本并用人类语言将其与物体一起流畅描述。基于两个已有的文本感知描述数据集,我们自动构建了 ControlTextCaps 和 ControlVizWiz 两个数据集以支持该任务。我们提出了一种新颖的几何与问题感知模型(Geometry and Question Aware Model, GQAM)。GQAM 首先应用几何信息视觉编码器在考虑空间关系的情况下融合区域级物体特征与区域级场景文本特征。然后,我们设计问题引导编码器为每个问题选择最相关的视觉特征。最后,GQAM 通过多模态解码器生成个性化的文本感知描述。我们的模型在两个数据集上比精心设计的基线具有更好的描述性能和问答能力。以问题作为控制信号,我们的模型比最先进的文本感知描述模型生成信息更丰富且更多样的描述。我们的代码和数据集公开于 https://github.com/HAWLYQ/Qc-TextCap。
引用
@article{arxiv.2108.02059,
title = {Question-controlled Text-aware Image Captioning},
author = {Anwen Hu and Shizhe Chen and Qin Jin},
journal= {arXiv preprint arXiv:2108.02059},
year = {2021}
}
备注
10 pages, 8 figures, to appear in ACM MM 2021