中文

SEM-POS:语法与语义正确的视频描述生成

计算机视觉与模式识别 2023-06-07 v2

摘要

在视频描述生成中,生成语法和语义正确的描述是一项具有挑战性的任务。现有方法生成的描述要么是逐词生成而不符合语法结构,要么遗漏了输入视频中的关键信息。为解决这些问题,我们提出了一种新颖的全局-局部融合网络,其中包含全局-局部融合块(GLFB),用于编码并融合来自不同词性(POS)组件与视觉-空间特征的特征。我们采用新颖的不同POS组件组合——‘限定词+主语’、‘助动词’、‘动词’和‘限定词+宾语’来分别监督POS块——Det+Subject、Aux Verb、Verb和Det+Object。这种新颖的全局-局部融合网络与POS块共同将视觉特征与语言描述对齐,以生成语法和语义正确的描述。在基准MSVD和MSRVTT数据集上的大量定性与定量实验表明,与现有方法相比,所提方法生成了更具语法和语义正确性的描述,达到了新的SOTA。对POS块和GLFB的消融实验证明了各项贡献对提出方法的影响。

关键词

引用

@article{arxiv.2303.14829,
  title  = {SEM-POS: Grammatically and Semantically Correct Video Captioning},
  author = {Asmar Nadeem and Adrian Hilton and Robert Dawes and Graham Thomas and Armin Mustafa},
  journal= {arXiv preprint arXiv:2303.14829},
  year   = {2023}
}