中文

少即是多:标签引导的程序性与教学视频摘要

计算机视觉与模式识别 2026-02-02 v2 人工智能

摘要

视频摘要有助于将长视频转化为清晰、简洁的表示,使其更易于回顾、记录和分析,尤其是在手术培训等高风险领域。先前的工作已从使用颜色、运动和结构变化等基本视觉特征,发展到使用预训练的视觉-语言模型,这些模型能更好地理解视频中发生的内容(语义)并捕捉时间流,从而产生更具上下文感知能力的视频摘要。我们提出了一个三阶段框架 PRISM:通过集成语义与多模态分析的程序性表示,用于生成语义扎实的视频摘要。PRISM 结合了自适应视觉采样、标签驱动的关键帧锚定以及使用大语言模型(LLM)的上下文验证。我们的方法确保所选帧能反映有意义且程序性的转换,同时过滤掉通用或幻觉内容,从而在特定领域和教学视频中生成上下文连贯的摘要。我们在教学和活动数据集上评估了我们的方法,并使用参考摘要评估教学视频。尽管只采样了不到 5% 的原始帧,我们的摘要保留了 84% 的语义内容,同时比基线方法提高了多达 33%。我们的方法可泛化到程序性和特定领域的视频任务,在语义对齐和精度方面均取得了优异性能。

关键词

引用

@article{arxiv.2601.12243,
  title  = {Less is More: Label-Guided Summarization of Procedural and Instructional Videos},
  author = {Shreya Rajpal and Michal Golovanevsky and Carsten Eickhoff},
  journal= {arXiv preprint arXiv:2601.12243},
  year   = {2026}
}

备注

22 pages, 6 figures