中文

AutoAD-Zero:零样本音频描述的训练-free 框架

计算机视觉与模式识别 2024-11-25 v2

摘要

我们的目标是以训练-free 的方式为电影和电视剧生成音频描述(AD)。我们利用即插即用的视觉语言模型(VLM)和大型语言模型(LLM)的强大功能,开发了视觉和文本提示策略以完成此任务。我们的贡献有三点:(i)我们展示了 VLM 在直接通过视觉指示提供角色信息后,无需任何微调即可成功命名和指代角色;(ii)开发了两个阶段的生成流程,第一阶段要求 VLM 全面描述视频,随后第二阶段利用 LLM 将稠密的文本信息浓缩为一句简洁的 AD 句子;(iii)构建了一个新的电视音频描述数据集。我们的方法称为 AutoAD-Zero,演示了其在电影和电视剧的 AD 生成中卓越的性能(甚至与一些在真实 AD 上进行微调的模型性能相当),实现了最新的 CRITIC 分数。

关键词

引用

@article{arxiv.2407.15850,
  title  = {AutoAD-Zero: A Training-Free Framework for Zero-Shot Audio Description},
  author = {Junyu Xie and Tengda Han and Max Bain and Arsha Nagrani and Gül Varol and Weidi Xie and Andrew Zisserman},
  journal= {arXiv preprint arXiv:2407.15850},
  year   = {2024}
}

备注

Project Page: https://www.robots.ox.ac.uk/~vgg/research/autoad-zero/