中文

UGC-VideoCaptioner:面向 Omni UGC 视频细粒度描述的模型与新基准

计算机视觉与模式识别 2025-10-07 v2

摘要

现实世界的用户生成视频,尤其是社交平台如 TikTok,常常具有丰富且交织的音视频内容。然而,现有的视频描述基准和模型仍以视觉为主,忽视了音频在传递场景动态、说话者意图和叙事情境中至关重要的作用。这种缺乏 Omni 数据集和轻量且功能强大的模型阻碍了细粒度多模态视频理解的进展。为解决这些挑战,我们引入了 UGC-VideoCap,这是一个针对短时段用户生成视频进行详细 Omnimodal 描述的新基准和模型框架。与先前的数据集不同,UGC-VideoCap 强调音视频模态的平衡集成,包含 1000 个来自 TikTok 的视频,通过覆盖音频仅、视觉仅和联合音视频语义的结构化三阶段人类在环注释流程进行标注。基准还包括 4000 个仔细构建的 QA 对,探测两模态和跨模态理解。配套数据集方面,我们提出了 UGC-VideoCaptioner(3B),一个来自 Gemini 2.5 Flash 蒸馏得到的 30 亿参数描述模型。我们采用新颖的两阶段训练策略,先进行监督微调,再进行群体相对策略优化 (GRPO),我们的做法能够从有限数据高效适应,同时保持竞争性能。我们的数据集和模型为在不受约束的真实世界 UGC 场景中推进 Omnimodal 视频描述提供了高质量的基础和数据高效解决方案。

关键词

引用

@article{arxiv.2507.11336,
  title  = {UGC-VideoCaptioner: An Omni UGC Video Detail Caption Model and New Benchmarks},
  author = {Peiran Wu and Yunze Liu and Zhengdong Zhu and Enmin Zhou and Junxiao Shen},
  journal= {arXiv preprint arXiv:2507.11336},
  year   = {2025}
}