中文

基于重要性-连贯性奖励的多模态片段组装网络用于广告视频编辑

计算机视觉与模式识别 2025-10-09 v2 人工智能 多媒体

摘要

广告视频编辑旨在将广告视频自动剪辑为更短的视频,同时保留连贯的内容以及广告主传达的关键信息。其主要包含两个阶段:视频分割与片段组装。现有方法在视频分割阶段表现良好,但存在依赖额外繁琐模型以及在片段组装阶段性能不佳的问题。为解决这些问题,我们提出 M-SAN(多模态片段组装网络,Multi-modal Segment Assemblage Network),该网络能够端到端地执行高效且连贯的片段组装任务。它利用从片段中提取的多模态表示,并遵循带有注意力机制的编码器-解码器 Ptr-Net 框架。我们设计了重要性-连贯性奖励用于训练 M-SAN。我们在 Ads-1k 数据集上进行了实验,该数据集包含从广告主处收集的 1000 多个丰富广告场景下的视频。为评估方法,我们提出了一个统一指标 Imp-Coh@Time,它同时综合评估输出的重要性、连贯性和时长。实验结果表明,我们的方法在该指标上优于随机选择和先前的方法。消融实验进一步验证了多模态表示和重要性-连贯性奖励显著提升了性能。Ads-1k 数据集可从以下地址获取:https://github.com/yunlong10/Ads-1k

关键词

引用

@article{arxiv.2209.12164,
  title  = {Multi-modal Segment Assemblage Network for Ad Video Editing with Importance-Coherence Reward},
  author = {Yolo Yunlong Tang and Siting Xu and Teng Wang and Qin Lin and Qinglin Lu and Feng Zheng},
  journal= {arXiv preprint arXiv:2209.12164},
  year   = {2025}
}

备注

Accepted by ACCV 2022