AutoAD-Zero:零样本音频描述的训练-free 框架
计算机视觉与模式识别
2024-11-25 v2
摘要
我们的目标是以训练-free 的方式为电影和电视剧生成音频描述(AD)。我们利用即插即用的视觉语言模型(VLM)和大型语言模型(LLM)的强大功能,开发了视觉和文本提示策略以完成此任务。我们的贡献有三点:(i)我们展示了 VLM 在直接通过视觉指示提供角色信息后,无需任何微调即可成功命名和指代角色;(ii)开发了两个阶段的生成流程,第一阶段要求 VLM 全面描述视频,随后第二阶段利用 LLM 将稠密的文本信息浓缩为一句简洁的 AD 句子;(iii)构建了一个新的电视音频描述数据集。我们的方法称为 AutoAD-Zero,演示了其在电影和电视剧的 AD 生成中卓越的性能(甚至与一些在真实 AD 上进行微调的模型性能相当),实现了最新的 CRITIC 分数。
引用
@article{arxiv.2407.15850,
title = {AutoAD-Zero: A Training-Free Framework for Zero-Shot Audio Description},
author = {Junyu Xie and Tengda Han and Max Bain and Arsha Nagrani and Gül Varol and Weidi Xie and Andrew Zisserman},
journal= {arXiv preprint arXiv:2407.15850},
year = {2024}
}
备注
Project Page: https://www.robots.ox.ac.uk/~vgg/research/autoad-zero/