中文

AutoAD III:前传——回归像素

计算机视觉与模式识别 2024-04-23 v1

摘要

为电影生成音频描述(AD)是一项具有挑战性的任务,需要细粒度的视觉理解以及对角色及其名字的认知。目前,用于AD生成的视觉语言模型受限于缺乏合适的训练数据,并且其评估也因使用非AD领域专用的性能指标而受到阻碍。本文做出三项贡献:(i)我们提出了两种构建带有对齐视频数据的AD数据集的方法,并利用这些方法构建了训练和评估数据集。这些数据集将公开发布;(ii)我们开发了一种基于Q-former的架构,该架构接收原始视频并生成AD,使用冻结的预训练视觉编码器和大型语言模型;(iii)我们提供了新的评估指标来基准测试AD质量,这些指标与人类表现高度匹配。综合来看,我们在AD生成方面改进了现有技术水平。

关键词

引用

@article{arxiv.2404.14412,
  title  = {AutoAD III: The Prequel -- Back to the Pixels},
  author = {Tengda Han and Max Bain and Arsha Nagrani and Gül Varol and Weidi Xie and Andrew Zisserman},
  journal= {arXiv preprint arXiv:2404.14412},
  year   = {2024}
}

备注

CVPR2024. Project page: https://www.robots.ox.ac.uk/~vgg/research/autoad/