中文

语音识别系统的样本高效无监督域自适应——以现代希腊语为例

计算与语言 2023-01-03 v1 声音 音频与语音处理

摘要

现代语音识别系统在域偏移下表现出快速的性能退化。这一问题在数据稀缺的环境中尤为普遍,例如低资源语言,其训练数据的多样性有限。在这项工作中,我们提出 M2DS2,一种针对大型预训练语音模型的简单且样本高效的微调策略,基于混合源域与目标域自监督。我们发现,纳入源域自监督可稳定训练并避免潜在表示的模式崩溃。为进行评估,我们收集了 HParl,一个 120120 小时的希腊语语音语料库,由希腊议会的全体会议的录音组成。我们将 HParl 与两个流行的希腊语语料库合并,创建了 GREC-MD,一个用于希腊语 ASR 系统多域评估的测试平台。在我们的实验中我们发现,尽管其他无监督域自适应基线在此资源受限环境中失效,M2DS2 仍能为跨域自适应带来显著改进,即便仅有几小时的域内音频可用。当我们在弱监督设定下放宽该问题时,我们发现使用 M2DS2 对音频进行独立自适应、并使用简单的 LM 增强技术对语言进行独立自适应尤其有效,产生的词错误率可与全监督基线相媲美。

关键词

引用

@article{arxiv.2301.00304,
  title  = {Sample-Efficient Unsupervised Domain Adaptation of Speech Recognition Systems A case study for Modern Greek},
  author = {Georgios Paraskevopoulos and Theodoros Kouzelis and Georgios Rouvalis and Athanasios Katsamanis and Vassilis Katsouros and Alexandros Potamianos},
  journal= {arXiv preprint arXiv:2301.00304},
  year   = {2023}
}