多模态可解释自动视频字幕生成
计算机视觉与模式识别
2024-11-12 v1 人工智能
摘要
视频字幕生成旨在使用自然语言格式描述视频内容,这涉及理解和解释同时在视图中发生的场景、动作和事件。当前方法主要集中于视觉线索,往往忽视了来自其他重要模态(如音频信息)的丰富信息及其相互依赖关系。在本工作中,我们提出了一种使用多模态对比损失训练的新型视频字幕生成方法,强调多模态融合与可解释性。我们的方法旨在捕捉这些模态之间的依赖关系,从而生成更准确、更相关的字幕。此外,我们强调了可解释性的重要性,采用了多种注意力机制来提供模型决策过程的解释。我们的实验结果表明,所提出的方法在常用的基准数据集MSR-VTT和VATEX上优于最先进模型。
引用
@article{arxiv.2411.06872,
title = {Multi-Modal interpretable automatic video captioning},
author = {Antoine Hanna-Asaad and Decky Aspandi and Titus Zaharia},
journal= {arXiv preprint arXiv:2411.06872},
year = {2024}
}