面向非规范语音识别的两阶段适应:重新审视面向个人化的说话人独立初始化
声音
2026-03-17 v1
摘要
为非规范语音(如困性说话语音和语颅语音)个性化自动语音识别(ASR)系统具有挑战性。虽然说话人特定微调(SS-FT)被广泛使用,但通常直接从通用预训练模型进行初始化。在此类不匹配情形下,是否采用说话人独立适应(SI-FT)可提供更强的初始化先验尚不明确。本文提出两阶段适应框架,包括在多说话人非规范语音数据上进行说话人独立微调(SI-FT),随后进行 SS-FT,我们通过在相同 per-speaker 条件下进行直接 SS-FT 的受控比较进行评估。实验在 AphasiaBank 和 UA-Speech 上进行,使用 Whisper-Large-v3 和 Qwen3-ASR,并在典型语音数据集 TED-LIUM v3 和 FLEURS 上进行评估,结果表明两阶段适应在保持可控的 out-of-domain(OOD)权衡的同时,持续改善了个性化效果。
引用
@article{arxiv.2603.15261,
title = {Two-Stage Adaptation for Non-Normative Speech Recognition: Revisiting Speaker-Independent Initialization for Personalization},
author = {Shan Jiang and Jiawen Qi and Chuanbing Huo and Yingqiang Gao and Qinyu Chen},
journal= {arXiv preprint arXiv:2603.15261},
year = {2026}
}
备注
submitted to Interspeech 2026