中文

面向视频字幕的神经符号表示:利用视觉与语言归纳偏置的一个案例

计算机视觉与模式识别 2020-11-20 v1 人工智能 图像与视频处理

摘要

神经符号表示已被证明在学习视觉与语言中的结构信息方面是有效的。在本文中,我们提出了一种新的模型架构,用于学习面向视频字幕的多模态神经符号表示。我们的方法使用基于字典学习的方法来学习视频及其配对文本描述之间的关系。我们将这些关系称为相对角色(relative roles),并利用它们通过注意力使每个词元具有角色感知能力。这产生了一个更具结构性和可解释性的架构,该架构为字幕任务融入了特定模态的归纳偏置。直观上,该模型能够学习给定视频-文本对中的空间、时间和跨模态关系。我们的方案所实现的解耦赋予了模型更强的捕捉多模态结构的能力,从而为视频生成更高质量的字幕。我们在两个成熟的视频字幕数据集上的实验基于自动指标验证了所提方法的有效性。我们进一步进行了人工评估以衡量生成字幕的接地性与相关性,并观察到所提模型的一致改进。代码与训练好的模型可在 https://github.com/hassanhub/R3Transformer 找到。

关键词

引用

@article{arxiv.2011.09530,
  title  = {Neuro-Symbolic Representations for Video Captioning: A Case for Leveraging Inductive Biases for Vision and Language},
  author = {Hassan Akbari and Hamid Palangi and Jianwei Yang and Sudha Rao and Asli Celikyilmaz and Roland Fernandez and Paul Smolensky and Jianfeng Gao and Shih-Fu Chang},
  journal= {arXiv preprint arXiv:2011.09530},
  year   = {2020}
}