中文

AutoAD II:续作——电影音频描述中的谁、何时与何事

计算机视觉与模式识别 2023-10-11 v1

摘要

音频描述(AD)是为视觉内容在合适时间间隔生成描述、以惠及视障观众的任务。对电影而言,这带来显著挑战——AD 必须仅出现在现有对话停顿中,应指名道姓地提及角色,且应有助于整体故事情节理解。为此,我们开发了一种自动生成电影 AD 的新模型,给定帧的 CLIP 视觉特征、演员表和语音的时间位置,解决“谁”“何时”“何事”三个问题:(i) 谁——我们引入由角色姓名、饰演演员及其面部 CLIP 特征组成的主要演员角色库,并展示其如何用于改善生成 AD 中的指名;(ii) 何时——我们研究若干模型,基于时间间隔及其邻域的视觉内容判断是否应为该间隔生成 AD;(iii) 何事——我们为此任务实现了一种新的视觉-语言模型,可摄入角色库的提案,同时利用交叉注意力对视觉特征条件化,并在同等对比下展示其相较以往 AD 文本生成架构的改进。

关键词

引用

@article{arxiv.2310.06838,
  title  = {AutoAD II: The Sequel -- Who, When, and What in Movie Audio Description},
  author = {Tengda Han and Max Bain and Arsha Nagrani and Gül Varol and Weidi Xie and Andrew Zisserman},
  journal= {arXiv preprint arXiv:2310.06838},
  year   = {2023}
}

备注

ICCV2023. Project page: https://www.robots.ox.ac.uk/vgg/research/autoad/