中文

Adapt4Me 演示:面向非标准语音的自适应语音识别作者环境

人机交互 2026-03-23 v1 人工智能

摘要

为非标准语音个性化自动语音识别(ASR)仍具有挑战性,因为数据收集耗时且模型训练技术复杂。为解决这些限制,我们提出Adapt4Me,一个基于贝叶斯主动学习的Web式去中心化环境,实现无需专家监督的端到端个性化。该应用通过三阶段人类在环工作流程将数据选择、适应和验证暴露给非专业用户:(1)通过贪心音素抽样进行快速轮廓,以捕获说话者特定的语音特征;(2)使用变分推断低秩适应(VI-LoRA)进行后端个性化,以实现快速增量更新;(3)持续改进,用户通过低摩擦的 Top-k 纠正来指导模型细化。通过使认识不确定性显式,Adapt4Me 将数据效率重新定义为交互式设计特征,而非纯算法问题。我们展示了这如何使用户能够个性化健壮的ASR模型,将其从被动数据来源转化为主动 authoring their own assistive technology 的主体。

关键词

引用

@article{arxiv.2603.20112,
  title  = {Demonstration of Adapt4Me: An Uncertainty-Aware Authoring Environment for Personalizing Automatic Speech Recognition to Non-normative Speech},
  author = {Niclas Pokel and Yiming Zhao and Pehuén Moure and Yingqiang Gao and Roman Böhringer},
  journal= {arXiv preprint arXiv:2603.20112},
  year   = {2026}
}