利用说话人信息个性化关键词 spotting
音频与语音处理
2023-11-08 v1 机器学习
声音
摘要
关键词 spotting 系统通常难以泛化到具有各种口音和年龄群体的多样化人群。为应对这一挑战,我们提出一种新方法,使用特征线性调制(FiLM)——一种近期从多源信息学习的方法——将说话人信息整合进关键词 spotting。我们探索了文本相关与文本无关的说话人识别系统来提取说话人信息,并实验了从输入音频和预注册用户音频中提取该信息。我们在多样化数据集上评估了我们的系统,并在关键词检测准确率上取得显著提升,尤其在代表性不足的说话人群体中。此外,我们提出的方法仅需要参数数量增加微小的1%,对延迟和计算成本影响最小,这使其成为实际应用的实用解决方案。
引用
@article{arxiv.2311.03419,
title = {Personalizing Keyword Spotting with Speaker Information},
author = {Beltrán Labrador and Pai Zhu and Guanlong Zhao and Angelo Scorza Scarpati and Quan Wang and Alicia Lozano-Diez and Alex Park and Ignacio López Moreno},
journal= {arXiv preprint arXiv:2311.03419},
year = {2023}
}