中文

多模态潜在主题引导的视频字幕生成

计算机视觉与模式识别 2023-02-15 v3 计算与语言

摘要

开放域视频的主题多样性导致描述视频内容时使用各种词汇和语言表达,从而使视频字幕任务更具挑战性。在本文中,我们提出了一个统一的字幕框架 M&M TGM,它以无监督方式从数据中挖掘多模态主题,并用这些主题引导字幕解码器。与预定义主题相比,挖掘出的多模态主题在语义和视觉上更连贯,并能更好地反映视频的主题分布。我们将主题感知的字幕生成形式化为一个多任务学习问题,其中除了字幕任务外,我们还添加了一个并行任务——主题预测。对于主题预测任务,我们使用挖掘出的主题作为教师来训练一个学生主题预测模型,该模型学习从视频的多模态内容中预测潜在主题。主题预测为学习过程提供了中间监督。对于字幕任务,我们提出了一种新颖的主题感知解码器,以在潜在主题的引导下生成更准确、更详细的视频描述。整个学习过程是端到端的,并同时优化两个任务。在 MSR-VTT 和 Youtube2Text 数据集上进行的大量实验结果证明了我们提出的模型的有效性。M&M TGM 不仅在多个评估指标和两个基准数据集上超越了先前最先进的方法,而且还实现了更好的泛化能力。

关键词

引用

@article{arxiv.1708.09667,
  title  = {Video Captioning with Guidance of Multimodal Latent Topics},
  author = {Shizhe Chen and Jia Chen and Qin Jin and Alexander Hauptmann},
  journal= {arXiv preprint arXiv:1708.09667},
  year   = {2023}
}

备注

ACM Multimedia 2017