中文

多模态可解释自动视频字幕生成

计算机视觉与模式识别 2024-11-12 v1 人工智能

摘要

视频字幕生成旨在使用自然语言格式描述视频内容,这涉及理解和解释同时在视图中发生的场景、动作和事件。当前方法主要集中于视觉线索,往往忽视了来自其他重要模态(如音频信息)的丰富信息及其相互依赖关系。在本工作中,我们提出了一种使用多模态对比损失训练的新型视频字幕生成方法,强调多模态融合与可解释性。我们的方法旨在捕捉这些模态之间的依赖关系,从而生成更准确、更相关的字幕。此外,我们强调了可解释性的重要性,采用了多种注意力机制来提供模型决策过程的解释。我们的实验结果表明,所提出的方法在常用的基准数据集MSR-VTT和VATEX上优于最先进模型。

关键词

引用

@article{arxiv.2411.06872,
  title  = {Multi-Modal interpretable automatic video captioning},
  author = {Antoine Hanna-Asaad and Decky Aspandi and Titus Zaharia},
  journal= {arXiv preprint arXiv:2411.06872},
  year   = {2024}
}