AdSum:用于自动视频广告剪辑的双流音视频摘要
计算机视觉与模式识别
2025-12-18 v2 信息检索
多媒体
摘要
广告商通常需要针对单一活动创建不同时长的广告版本。传统方法通过手动挑选和重新编辑较长视频广告中的片段以创建更短版本,过程繁琐且耗时。本文提出了一种基于视频摘要技术的自动视频广告剪辑框架。我们首次将视频剪辑定义为针对广告场景的片段选择问题。不同于现有通用视频摘要方法主要关注视觉内容,本方法强调音频在广告中的关键作用。为实现此目标,我们开发了双流音视频融合模型,用于预测视频帧的重要性,其中重要性定义为该帧被选入最终精简广告的概率。为解决缺乏广告专用数据集的问题,我们提出AdSum204数据集,包含102对来自真实广告活动的30秒和15秒广告。大量实验表明,我们的方法在各种指标上(包括平均精度、曲线下面积、斯佩尔曼相关系数和肯德尔系数)均优于最先进的方法。数据集与代码可在 https://github.com/ostadabbas/AdSum204 查阅。
引用
@article{arxiv.2510.26569,
title = {AdSum: Two-stream Audio-visual Summarization for Automated Video Advertisement Clipping},
author = {Wen Xie and Yanjun Zhu and Gijs Overgoor and Yakov Bart and Agata Lapedriza Garcia and Sarah Ostadabbas},
journal= {arXiv preprint arXiv:2510.26569},
year = {2025}
}
备注
Accepted at 32nd International Conference on MultiMedia Modeling