面向口音说话人的误差驱动固定预算 ASR 个性化
声音
2021-06-03 v2 计算与语言
音频与语音处理
摘要
我们考虑在录制说话人特定语句的预算固定受限的条件下个性化 ASR 模型的任务。给定一个说话人和一个 ASR 模型,我们提出一种识别句子的方法,说话人针对这些句子的语音很可能更难被给定 ASR 模型识别。我们假设使用极少量的说话人特定数据来学习音素级错误模型,从而帮助我们筛选此类句子。我们表明,与使用随机选取句子上的说话人语音相比,说话人在由我们的错误模型所选句子上的语音确实具有更大的错误率。我们发现,借助错误模型所选句子语音对 ASR 模型进行微调,相较于在同等数量的随机选取句子语音上微调,能获得更高的 WER 提升。因此,我们的方法在预算约束下为收集说话人语音以个性化 ASR 模型提供了一种高效途径。
引用
@article{arxiv.2103.03142,
title = {Error-driven Fixed-Budget ASR Personalization for Accented Speakers},
author = {Abhijeet Awasthi and Aman Kansal and Sunita Sarawagi and Preethi Jyothi},
journal= {arXiv preprint arXiv:2103.03142},
year = {2021}
}
备注
In ICASSP 2021