中文

视觉文本校正

计算机视觉与模式识别 2019-01-01 v3 计算与语言

摘要

视频、图像和句子都是能够表达相同语义的媒介。人们可以通过读一句话来想象一幅画面,或者用一些词语描述一个场景。然而,即使句子中的微小改动也会引发与相应视频/图像显著的语义不一致。例如,改变句子中的动词可能使含义发生剧烈变化。已有许多工作致力于编码视频/句子并将其解码为句子/视频。在本研究中,我们探讨了一种新场景:句子和视频均给定,但句子不准确。句子与视频之间或句子内部词语之间的语义不一致会导致描述不准确。本文提出了一个称为视觉文本校正(Visual Text Correction, VTC)的新问题,即寻找并替换视频文本描述中不准确的词。我们提出了一种深度网络,能够同时检测句子中的不准确之处,并通过替换不准确词来修正。我们的方法利用了视频与词语的语义相互依赖关系,以及句子中词语的短期与长期关系。在我们的表述中,每个词语的视觉特征向量的一部分通过门控过程动态选取。此外,为训练和评估我们的模型,我们提出了一种自动构建大规模 VTC 问题数据集的方法。我们的实验与性能分析表明所提方法取得了非常好的结果,并揭示了解决 VTC 问题的一般性挑战。据我们所知,这项工作是视觉文本校正任务中的首创。

关键词

引用

@article{arxiv.1801.01967,
  title  = {Visual Text Correction},
  author = {Amir Mazaheri and Mubarak Shah},
  journal= {arXiv preprint arXiv:1801.01967},
  year   = {2019}
}