中文

看、听与识别:角色感知的视听字幕生成

计算机视觉与模式识别 2024-01-23 v1 声音 音频与语音处理

摘要

本文的目标是自动生成角色感知的字幕。给定一段视频和极少量的元数据,我们提出一种视听方法,可生成完整的对话文本,包含精确的语音时间戳,并识别出说话的角色。其核心思想是首先利用视听线索为每个角色选取一组高精度的音频样本,然后利用这些样本按说话人身份对所有语音片段进行分类。值得注意的是,该方法不需要人脸检测或跟踪。我们在包括《宋飞正传》、《欢乐一家亲》和《实习医生风云》在内的多种电视情景喜剧上评估了该方法。我们设想该系统可用于自动生成字幕,以提高现代流媒体服务上大量视频的可访问性。项目页面:\url{https://www.robots.ox.ac.uk/~vgg/research/look-listen-recognise/}

关键词

引用

@article{arxiv.2401.12039,
  title  = {Look, Listen and Recognise: Character-Aware Audio-Visual Subtitling},
  author = {Bruno Korbar and Jaesung Huh and Andrew Zisserman},
  journal= {arXiv preprint arXiv:2401.12039},
  year   = {2024}
}

备注

Accepted for publication in ICASSP 2024