中文

通用个人化器:基于元学习的零样本/少样本失语语音识别

音频与语音处理 2026-02-24 v2 声音

摘要

为个性化失语语音识别 (dysarthric ASR) 进行定制化,受限于严苛的录入收集和 per-user 训练。在本文中,我们提出一种混合元训练方法,针对单个模型实现零样本和少样本即插即用个人化,通过情境学习 (in-context learning, ICL) 实现。我们在 Euphonia 数据集上实现了 13.9% 的词错误率 (Word Error Rate, WER),超越说话人独立基线 (17.5%)。在 SAP Test-1 上,我们的 5.3% WER 战胜了获奖团队 (5.97%)。在 Test-2 上,我们的 9.49% WER 仅次于获奖者 (8.11%),但无需依赖离线模型合并或自定义音频块等技术。通过随机相同说话人示例进行精选可实现 40% 的 WER 降低,验证了主动个人化的有效性。虽然静态文本精选未能战胜此基线,但 oracle 相似度揭示了显著的提升空间,凸显动态声学检索为下一 frontier。数据消融实验确认了快速低资源说话人适应的能力,使该模型成为实用的个人化解决方案。

关键词

引用

@article{arxiv.2509.15516,
  title  = {The Universal Personalizer: Few-Shot Dysarthric Speech Recognition via Meta-Learning},
  author = {Dhruuv Agarwal and Harry Zhang and Yang Yu and Quan Wang},
  journal= {arXiv preprint arXiv:2509.15516},
  year   = {2026}
}