基于堆叠注意力与语义硬提取的视频描述生成
计算机视觉与模式识别
2023-10-17 v3
摘要
视频描述生成,即从视频序列生成字幕的任务,在计算机科学的自然语言处理与计算机视觉领域之间架起桥梁。生成语义准确的视频描述是一项颇为复杂的任务。考虑到问题的复杂性,近期研究工作中所取得的成果值得称道。然而,仍有大量进一步探究的空间。本文针对此空间提出一种新颖解决方案。多数视频描述模型包含两层顺序/循环层——一层作为视频到上下文的编码器,另一层作为上下文到字幕的解码器。本文提出一种新颖架构,即语义合理视频描述生成(SSVC),其通过两种新方法——"堆叠注意力"与"空间硬提取"——改进上下文生成机制。由于尚无专门用于评估视频描述模型的指标,我们强调对模型进行定量与定性分析。为此,我们采用 BLEU 评分指标进行定量分析,并提出一种用于定性分析的人类评估指标,即语义合理性(SS)评分指标。SS 分数克服了常见自动评分指标的不足。本文报告称,上述新方法的运用提升了最先进架构的性能。
引用
@article{arxiv.2009.07335,
title = {Video captioning with stacked attention and semantic hard pull},
author = {Md. Mushfiqur Rahman and Thasin Abedin and Khondokar S. S. Prottoy and Ayana Moshruba and Fazlul Hasan Siddiqui},
journal= {arXiv preprint arXiv:2009.07335},
year = {2023}
}