中文

无监督转录本辅助的视频摘要与高光检测

计算机视觉与模式识别 2025-05-30 v1 人工智能 多媒体

摘要

视频消费是日常生活的重要组成部分,但观看完整视频可能十分繁琐。为解决这一问题,研究人员探索了视频摘要与高光检测以识别关键视频片段。虽然部分工作结合了视频帧与转录本,另一些工作则使用强化学习(RL)处理视频摘要与高光检测,但据我们所知,目前尚无工作将这两种模态整合于一个 RL 框架内。在本文中,我们提出了一种多模态流水线,利用视频帧及其对应转录本,通过模态融合机制生成视频的更精简版本并检测高光片段。该流水线在 RL 框架内训练,通过奖励模型生成多样且具代表性的摘要,同时确保包含具有有意义转录内容的视频片段。训练的无监督特性允许从大规模无标注数据集中学习,克服了现有标注数据集规模有限所带来的挑战。我们的实验表明,在视频摘要与高光检测中使用转录本,相比仅依赖视频视觉内容取得了更优的结果。

关键词

引用

@article{arxiv.2505.23268,
  title  = {Unsupervised Transcript-assisted Video Summarization and Highlight Detection},
  author = {Spyros Barbakos and Charalampos Antoniadis and Gerasimos Potamianos and Gianluca Setti},
  journal= {arXiv preprint arXiv:2505.23268},
  year   = {2025}
}