中文

基于多模态一致性引导的自参考无标签语音识别元音适应数据选择

计算与语言 2026-02-17 v1 声音 音频与语音处理

摘要

自动语音识别(ASR)系统常因语音-音素和韵律变化导致在带元音的语音上性能下降,这会导致训练数据不匹配,使带标签元音适应成本高昂。然而,常见的伪标签选择启发式方法主要基于文本(例如困惑度PPL过滤),可能倾向于流畅但声学上不匹配的假设,在微调时导致误差放大。为此,我们提出一种用于ASR元音适应的、基于多模态一致性引导、无参考的数据选择管道,遵循无标签的 transductive 协议。该管道首先基于子可约互信息进行目标感知预筛选,以提高查询相关性并减少下游计算。随后通过扰动式解码生成每个utterance的多个伪转录,并使用两种无参考信号对每个假设进行评分:在共享嵌入空间中的语音-文本对齐和预测的词错误率(WER)。采用简单的百分位选择规则保留可靠的伪标签以进行微调,同时丢弃噪声utterance。在域内设置下,从30k的候选池中选择约1.5k个utterance即可实现10.91%的WER,接近使用30k个监督标签的10.45%。在跨域设置下,针对强元音迁移的一致性过滤子集避免了未过滤伪标签导致的性能下降,matched-hour实验在更强的ASR主干模型上进一步确认了相对于随机采样和最新选择方法的提升。

关键词

引用

@article{arxiv.2602.13263,
  title  = {Multimodal Consistency-Guided Reference-Free Data Selection for ASR Accent Adaptation},
  author = {Ligong Lei and Wenwen Lu and Xudong Pang and Zaokere Kadeer and Aishan Wumaier},
  journal= {arXiv preprint arXiv:2602.13263},
  year   = {2026}
}