利用 GAN 实现视觉语音识别中新类的零样本学习
机器学习
2020-01-03 v4 机器学习
摘要
视觉语音识别(VSR)是通过观察说话者唇部运动来识别或解读语音的过程。近期基于机器学习的方法将 VSR 建模为分类问题;然而,训练数据的稀缺导致系统易出错,在预测未见类时准确率很低。为解决该问题,我们提出一种利用生成对抗网络(GANs)生成新类的零样本学习新方法,并展示了未见类样本的加入将 VSR 系统的准确率显著提升了 27%,并使其能处理说话者无关的词汇表外短语。我们还展示了我们的模型是语言无关的,因此能够利用英语训练数据无缝生成新语言(印地语)的视频。据我们所知,这是首项展示 GAN 在 VSR 领域用于生成未见类训练样本从而促进零样本学习的实证证据的工作。我们公开了新增的新类视频及我们的代码。
引用
@article{arxiv.1901.10139,
title = {Harnessing GANs for Zero-shot Learning of New Classes in Visual Speech Recognition},
author = {Yaman Kumar and Dhruva Sahrawat and Shubham Maheshwari and Debanjan Mahata and Amanda Stent and Yifang Yin and Rajiv Ratn Shah and Roger Zimmermann},
journal= {arXiv preprint arXiv:1901.10139},
year = {2020}
}
备注
Accepted for poster presentation at AAAI 2020. Dhruva Sahrawat and Yaman Kumar contributed equally to this work