中文

基于堆叠注意力与语义硬提取的视频描述生成

计算机视觉与模式识别 2023-10-17 v3

摘要

视频描述生成,即从视频序列生成字幕的任务,在计算机科学的自然语言处理与计算机视觉领域之间架起桥梁。生成语义准确的视频描述是一项颇为复杂的任务。考虑到问题的复杂性,近期研究工作中所取得的成果值得称道。然而,仍有大量进一步探究的空间。本文针对此空间提出一种新颖解决方案。多数视频描述模型包含两层顺序/循环层——一层作为视频到上下文的编码器,另一层作为上下文到字幕的解码器。本文提出一种新颖架构,即语义合理视频描述生成(SSVC),其通过两种新方法——"堆叠注意力"与"空间硬提取"——改进上下文生成机制。由于尚无专门用于评估视频描述模型的指标,我们强调对模型进行定量与定性分析。为此,我们采用 BLEU 评分指标进行定量分析,并提出一种用于定性分析的人类评估指标,即语义合理性(SS)评分指标。SS 分数克服了常见自动评分指标的不足。本文报告称,上述新方法的运用提升了最先进架构的性能。

关键词

引用

@article{arxiv.2009.07335,
  title  = {Video captioning with stacked attention and semantic hard pull},
  author = {Md. Mushfiqur Rahman and Thasin Abedin and Khondokar S. S. Prottoy and Ayana Moshruba and Fazlul Hasan Siddiqui},
  journal= {arXiv preprint arXiv:2009.07335},
  year   = {2023}
}