基于 CNN 通用验证器的服务机器人单次说话人识别
音频与语音处理
2018-09-13 v1 声音
摘要
在服务机器人领域,通过语音 alone 识别用户具有研究价值。然而,在服务机器人充当服务员或店员的场景中,新用户预期会频繁进入环境。通常,说话人识别模型在此时需要重新训练,这可能耗费不切实际的时间。本文提出了一种通过验证进行说话人识别的新方法,使用连体卷积神经网络架构(SCNN),其学习通用地验证两段音频信号是否来自同一说话人。通过维护一个包含用户录音的外部数据库,识别过程通过将语音输入与该库中每条记录进行验证来完成。若遇到新用户,只需将其录音加入外部数据库即可被识别,无需重新训练。该系统从四个方面进行了评估:验证器性能、使用干净音频时系统作为分类器的性能、速度以及真实环境中的准确率。其性能结合单次学习能力,使所提系统成为服务机器人说话人识别的可行替代方案。
引用
@article{arxiv.1809.04115,
title = {One-Shot Speaker Identification for a Service Robot using a CNN-based Generic Verifier},
author = {Ivette Vélez and Caleb Rascon and Gibrán Fuentes-Pineda},
journal= {arXiv preprint arXiv:1809.04115},
year = {2018}
}
备注
8 pages, 9 figures, 2 tables. This paper is under review as a Submission for RA-L and ICRA for the IEEE Robotics and Automation Letters (RA-L). A video demonstration of the full system, as well as all relevant downloads (corpora, source code, models, etc.) can be found at: http://calebrascon.info/oneshotid/