AutoAD III:前传——回归像素
计算机视觉与模式识别
2024-04-23 v1
摘要
为电影生成音频描述(AD)是一项具有挑战性的任务,需要细粒度的视觉理解以及对角色及其名字的认知。目前,用于AD生成的视觉语言模型受限于缺乏合适的训练数据,并且其评估也因使用非AD领域专用的性能指标而受到阻碍。本文做出三项贡献:(i)我们提出了两种构建带有对齐视频数据的AD数据集的方法,并利用这些方法构建了训练和评估数据集。这些数据集将公开发布;(ii)我们开发了一种基于Q-former的架构,该架构接收原始视频并生成AD,使用冻结的预训练视觉编码器和大型语言模型;(iii)我们提供了新的评估指标来基准测试AD质量,这些指标与人类表现高度匹配。综合来看,我们在AD生成方面改进了现有技术水平。
引用
@article{arxiv.2404.14412,
title = {AutoAD III: The Prequel -- Back to the Pixels},
author = {Tengda Han and Max Bain and Arsha Nagrani and Gül Varol and Weidi Xie and Andrew Zisserman},
journal= {arXiv preprint arXiv:2404.14412},
year = {2024}
}
备注
CVPR2024. Project page: https://www.robots.ox.ac.uk/~vgg/research/autoad/