面向端到端语音识别的说话人平滑kNN说话人自适应
声音
2024-07-03 v3 音频与语音处理
摘要
尽管端到端自动语音识别(E2E ASR)系统最近取得了改进,但由于训练和测试数据之间的发声特性不匹配,尤其是在目标说话人自适应数据有限的情况下,性能可能会下降。我们提出了一种新颖的说话人自适应方法——说话人平滑kNN,该方法利用k近邻(kNN)检索技术,在解码阶段通过从预先构建的数据存储中检索正确发音的标记来改善模型输出。此外,我们利用x向量动态调整kNN插值参数以应对数据稀疏问题。该方法在KeSpeech和MagicData语料库上,在域内和全域设置下进行了验证。我们的方法在说话人切换时始终表现出与微调相当的性能,且没有相关的性能下降。此外,在全域设置下,我们的方法取得了最先进的结果,在单说话人和多说话人测试场景中均降低了字符错误率(CER)。
引用
@article{arxiv.2406.04791,
title = {Speaker-Smoothed kNN Speaker Adaptation for End-to-End ASR},
author = {Shaojun Li and Daimeng Wei and Hengchao Shang and Jiaxin Guo and ZongYao Li and Zhanglin Wu and Zhiqiang Rao and Yuanchang Luo and Xianghui He and Hao Yang},
journal= {arXiv preprint arXiv:2406.04791},
year = {2024}
}
备注
Accepted to Interspeech 2024