Personal VAD 2.0:面向端侧语音识别的个性化语音活动检测优化
音频与语音处理
2022-06-28 v3 机器学习
声音
摘要
近年来,端侧语音识别(ASR)的个性化呈现爆发式增长,很大程度上得益于移动设备和智能音箱上个人助手功能日益普及。在这项工作中,我们提出 Personal VAD 2.0,一种个性化语音活动检测器,作为流式端侧 ASR 系统的一部分,用于检测目标说话人的语音活动。尽管先前概念验证研究已证实 Personal VAD 的有效性,但在该模型投入生产前仍有若干关键挑战待解决:首先,在注册(enrollment)和无注册场景下质量均需令人满意;其次,它应以流式方式运行;最后,模型大小应足够小以适配有限的延迟和 CPU/内存预算。为满足多方面需求,我们提出一系列新颖设计:1)先进的说话人嵌入调制方法;2)用于泛化到无注册条件的新训练范式;3)针对延迟和资源限制的架构与运行时优化。在真实语音识别系统上的大量实验证明了我们所提方法的 SOTA 性能。
引用
@article{arxiv.2204.03793,
title = {Personal VAD 2.0: Optimizing Personal Voice Activity Detection for On-Device Speech Recognition},
author = {Shaojin Ding and Rajeev Rikhye and Qiao Liang and Yanzhang He and Quan Wang and Arun Narayanan and Tom O'Malley and Ian McGraw},
journal= {arXiv preprint arXiv:2204.03793},
year = {2022}
}
备注
Accepted by INTERSPEECH 2022