ValSub:子采样验证数据以缓解 ASR 个性化过程中的遗忘
音频与语音处理
2025-04-08 v2 声音
摘要
自动语音识别(ASR)广泛应用于手机等消费设备中。最近,个性化或设备端模型微调表明,针对目标用户语音的 ASR 模型自适应可以提升其对罕见词汇或口音语音的性能。尽管取得了这些收益,但在用户数据(目标域)上进行微调会使个性化模型遗忘其原始训练分布(源域)中的知识,即发生灾难性遗忘,导致通用 ASR 性能下降。一种简单且高效的方法是通过代表源域分布的验证集来衡量遗忘程度。然而,此类验证集规模庞大,在移动设备上不切实际。为此,本文提出了一种新方法,将大规模验证集子采样为规模较小的验证集,同时保持估计遗忘的能力。通过利用该数据集动态确定理想的微调轮次数量,本文展示了其在缓解遗忘方面的有效性。当测量各用户微调轮次相对于 50 倍规模的验证集(Oracle)的偏差时,本文方法取得了更低的平均绝对误差(3.39),而相同规模的随机子集为 3.78–8.65。与随机基线不同,本文方法在三个不同的遗忘阈值下始终跟踪 Oracle 的行为。
引用
@article{arxiv.2503.09906,
title = {ValSub: Subsampling Validation Data to Mitigate Forgetting during ASR Personalization},
author = {Haaris Mehmood and Karthikeyan Saravanan and Pablo Peso Parada and David Tuckey and Mete Ozay and Gil Ho Lee and Jungin Lee and Seokyeong Jung},
journal= {arXiv preprint arXiv:2503.09906},
year = {2025}
}
备注
Accepted at ICASSP 2025