中文

看见唤醒词:音视觉关键词 spotting

计算机视觉与模式识别 2020-09-07 v1 音频与语音处理

摘要

本工作的目标是自动判断一段说话人脸视频中是否以及在何时说出了感兴趣的词,无论是否有音频。我们提出了一种适用于野外视频的零样本方法。我们的关键贡献为:(1) 一种新颖的卷积架构 KWS-Net,它使用相似度图中间表示将任务分离为(i)序列匹配和(ii)模式检测,以判定该词是否存在及其出现时刻;(2) 我们证明若有音频可用,视觉关键词 spotting 在干净与含噪音频信号下均能提升性能。最后,(3) 我们表明该方法可泛化至其他语言,具体而言为法语和德语,并通过微调在英语上预训练的网络,以较少的语言特定数据取得与英语相当的性能。该方法在相同基准上训练与测试时,超越了先前最先进的视觉关键词 spotting 架构以及一种最先进的唇读方法的性能。

关键词

引用

@article{arxiv.2009.01225,
  title  = {Seeing wake words: Audio-visual Keyword Spotting},
  author = {Liliane Momeni and Triantafyllos Afouras and Themos Stafylakis and Samuel Albanie and Andrew Zisserman},
  journal= {arXiv preprint arXiv:2009.01225},
  year   = {2020}
}