面向真实场景视觉语音识别的零样本关键词 spotting
计算机视觉与模式识别
2018-07-27 v2
摘要
视觉关键词 spotting(KWS)是指仅利用视频信息估计给定录音中是否出现文本查询的问题。本文关注训练时未见过词的视觉 KWS,这是一种现实、实用的设定,迄今未受学界关注。为此,我们设计了一个端到端架构,包含 (a) 基于时空残差网络(Residual Networks)的最先进视觉特征提取器,(b) 基于序列到序列神经网络的字素到音素模型,以及 (c) 学习如何将视觉特征与关键词表示相关联的循环神经网络栈。与先前试图仅从字素(即字母)序列学习词表示的 KWS 工作不同,我们提出使用字素到音素编码器-解码器模型,学习如何将词映射到其发音。我们证明了我们的系统在具有挑战性的 LRS2 数据库上,对训练时未见过的关键词,取得了非常有前景的纯视觉 KWS 结果。我们也展示了我们的系统优于通过自动语音识别(ASR)解决 KWS 的基线,同时大幅改进了其他近期提出的无 ASR 的 KWS 方法。
引用
@article{arxiv.1807.08469,
title = {Zero-shot keyword spotting for visual speech recognition in-the-wild},
author = {Themos Stafylakis and Georgios Tzimiropoulos},
journal= {arXiv preprint arXiv:1807.08469},
year = {2018}
}
备注
Accepted at ECCV-2018