中文

HierSum:用于视频摘要的全局与局部注意力机制

计算机视觉与模式识别 2025-04-29 v1 人工智能 机器学习

摘要

视频摘要创建了一个简短版本(即摘要),以提供视频的快速概览,同时保留相关信息。本文聚焦于概述说明性视频,提出一种将视频分解为有意义片段的方法,每个片段对应视频中的关键步骤。我们提出了HierSum,一种分层方法,集成了来自字幕的细粒度局部线索与来自视频级指令提供的全局上下文信息。我们的方法利用“最常重复”统计信息作为监督信号,以识别关键片段,从而提高摘要的有效性。我们在TVSum、BLiSS、Mr.HiSum和WikiHow测试集上进行评估,显示HierSum在F1分数和秩相关等关键指标上 consistently 优于现有方法。我们还整理了一个新的多模态数据集,使用WikiHow和EHow视频及其包含分步骤指令的文章。通过大量消融研究,我们表明在该数据集上进行训练显著增强了在目标数据集上的摘要效果。

关键词

引用

@article{arxiv.2504.18689,
  title  = {HierSum: A Global and Local Attention Mechanism for Video Summarization},
  author = {Apoorva Beedu and Irfan Essa},
  journal= {arXiv preprint arXiv:2504.18689},
  year   = {2025}
}