中文

面向视频摘要的自动化多模态方法:构建文本、音频与面部线索摘要之间的桥梁

计算机视觉与模式识别 2025-07-01 v1 计算与语言

摘要

教育、专业和社交领域的视频内容量不断增加, necessitate effective 的摘要技术,这些技术超越了传统的单模态方法。本文提出了一个行为感知的多模态视频摘要框架,将文本、音频和视觉线索集成以生成时间戳对齐的摘要。通过提取副声特征、文本线索和视觉指示符,框架识别语义和情感上重要的时刻。一个关键贡献是识别 bonus 单词,这些词在多个模态中被强调,用于改进摘要的语义相关性和表达清晰度。该方法针对使用 LLM 基于提取方法生成的伪真实 (pGT) 摘要进行评估。实验结果在文本和视频基于评估指标方面均显示出对传统提取方法(如 Edmundson 方法)的显著改进。文本指标显示 ROUGE-1 从 0.4769 提升至 0.7929,BERTScore 从 0.9152 提升至 0.9536,而在视频评估中,我们的方法在 F1-得分上提高了近 23%。这些发现凸显了多模态集成在产生全面且行为感知视频摘要方面的潜力。

关键词

引用

@article{arxiv.2506.23714,
  title  = {Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization},
  author = {Md Moinul Islam and Sofoklis Kakouros and Janne Heikkilä and Mourad Oussalah},
  journal= {arXiv preprint arXiv:2506.23714},
  year   = {2025}
}

备注

Accepted to HHAI WS 2025: Workshops at the Fourth International Conference on Hybrid Human-Artificial Intelligence (HHAI)