中文

Shot-by-Shot:基于电影语法的无训练音频描述生成

计算机视觉与模式识别 2025-09-16 v2

摘要

我们的目标是自动为编辑后的视频素材(如电影和电视剧)生成音频描述(AD)。为实现此目标,我们提出了一个两阶段框架,将“镜头”作为视频理解的基本单元。该框架扩展了相邻镜头的时序上下文,并融入电影语法设备(如镜头规模和线索结构),以引导AD生成。该方法兼容开源和专有视觉语言模型(VLM),通过附加模块集成专家知识,无需对VLM进行额外训练。我们在所有先前无训练方法中实现了最高的性能,甚至在多个基准测试上超越了微调方法。为评估预测AD的质量,我们引入了新的评估措施——行动得分——专门针对评估这一重要方面。此外,我们提出了一种新型评估协议,将自动化框架视为AD生成助理,要求其为选择生成多个候选AD。

关键词

引用

@article{arxiv.2504.01020,
  title  = {Shot-by-Shot: Film-Grammar-Aware Training-Free Audio Description Generation},
  author = {Junyu Xie and Tengda Han and Max Bain and Arsha Nagrani and Eshika Khandelwal and Gül Varol and Weidi Xie and Andrew Zisserman},
  journal= {arXiv preprint arXiv:2504.01020},
  year   = {2025}
}

备注

ICCV 2025. Project Page: https://www.robots.ox.ac.uk/vgg/research/shot-by-shot/