中文

鲁棒变化描述生成

计算机视觉与模式识别 2019-04-18 v2 人工智能

摘要

描述场景中发生的变化对用户可能很有用,但前提是生成的文本聚焦于语义相关的部分。因此,区分干扰项(例如视角变化)与相关变化(例如物体发生移动)十分重要。我们提出了一种新颖的双动态注意力模型(DUDA)来进行鲁棒的变化描述生成(Change Captioning)。我们的模型学习将干扰项与语义变化区分开来,通过针对“前”和“后”图像的双重注意力(Dual Attention)定位变化,并通过动态描述器(Dynamic Speaker)自适应地聚焦于必要的视觉输入(例如“前”或“后”图像)以自然语言准确地描述这些变化。为深入研究该问题,我们基于 CLEVR 引擎收集了一个 CLEVR-Change 数据集,包含 5 种类型的场景变化。我们在该数据集上对比了若干基线方法,并系统地研究了不同的变化类型以及对干扰项的鲁棒性。我们展示了我们的 DUDA 模型在变化描述生成与定位两方面的优越性。我们还表明我们的方法是通用的,在近期无干扰项的真实 Spot-the-Diff 数据集上取得了最先进(state-of-the-art)的结果。

关键词

引用

@article{arxiv.1901.02527,
  title  = {Robust Change Captioning},
  author = {Dong Huk Park and Trevor Darrell and Anna Rohrbach},
  journal= {arXiv preprint arXiv:1901.02527},
  year   = {2019}
}