面向基于文本的图像描述的内容多样性探索以实现准确描述
计算机视觉与模式识别
2021-05-10 v1
摘要
基于文本的图像描述(TextCap)旨在读取并推理含文本的图像,考虑到文本在日常生活中无处不在,这对于机器理解细致而复杂的场景环境至关重要。然而,该任务极具挑战性,因为图像常包含难以被全面描述的复杂文本与视觉信息。现有方法试图扩展传统图像描述方法来解决此任务,其侧重于用一条全局描述来刻画图像的整体场景。这并不可行,因为复杂的文本与视觉信息无法在一条描述中得到良好表达。为化解此困难,我们致力于生成多条描述,以准确细致地刻画图像的不同部分。为实现该目标,存在三个关键挑战:1)难以决定应复制或改写图像中的哪些文本部分;2)捕捉图像中多样化文本之间的复杂关系并非易事;3)如何生成内容多样的多条描述仍是一个开放问题。为攻克这些,我们提出一种新颖的 Anchor-Captioner 方法。具体而言,我们首先找出应被给予更多关注的重要词元并将其视为锚点。然后,针对每个所选锚点,我们将与其相关的文本分组以构建相应的以锚点为中心的图(ACG)。最后,基于不同的 ACG,我们进行多视角描述生成以提升生成描述的内容多样性。实验结果表明,我们的方法不仅取得了 SOTA 性能,还能生成多样化描述来刻画图像。
引用
@article{arxiv.2105.03236,
title = {Towards Accurate Text-based Image Captioning with Content Diversity Exploration},
author = {Guanghui Xu and Shuaicheng Niu and Mingkui Tan and Yucheng Luo and Qing Du and Qi Wu},
journal= {arXiv preprint arXiv:2105.03236},
year = {2021}
}
备注
Accepted by CVPR 2021