中文

从用户生成内容到视频改造:大规模数据集与基准

计算机视觉与模式识别 2024-12-17 v2

摘要

针对社交媒体平台上短视频制作需求的快速增长,尽管视频摘要和精彩检测领域取得了显著进展,但这些方法往往具有特定的领域限制,要求对真实视频内容进行深入理解。为解决此问题,我们提出Repurpose-10K数据集,包含超过10,000个视频及120,000个标注片段,以解决视频长短转换任务。鉴于未经过训练的人类标注者可能导致改造视频标注不准,本文提出了两个阶段的解决方案,从真实用户生成内容中获取标注。此外,我们提供了一个基线模型,通过跨模态融合与对齐框架集成音频、视觉和标题信息,以应对这一挑战性任务。我们希望本工作能在视频改造这一较少探索的领域催生突破性的研究。

关键词

引用

@article{arxiv.2412.08879,
  title  = {Video Repurposing from User Generated Content: A Large-scale Dataset and Benchmark},
  author = {Yongliang Wu and Wenbo Zhu and Jiawang Cao and Yi Lu and Bozheng Li and Weiheng Chi and Zihan Qiu and Lirian Su and Haolin Zheng and Jay Wu and Xu Yang},
  journal= {arXiv preprint arXiv:2412.08879},
  year   = {2024}
}

备注

AAAI2025