中文

自监督模型在语音转文本系统中性别影响的研究

计算与语言 2022-07-06 v2 声音 音频与语音处理

摘要

用于语音处理的自监督模型近来作为语音处理流程中流行的基础模块出现。这些模型在未标注音频数据上预训练,然后用于自动语音识别(ASR)或语音翻译(ST)等语音处理下游任务。由于这些模型现在同样用于研究和工业系统,理解预训练数据中性别分布等特征所造成的影响变得必要。以法语为研究语言,我们训练并比较了性别特定的 wav2vec 2.0 模型与预训练数据中包含不同程度性别平衡的模型。通过将模型应用于两个语音转文本下游任务(ASR 和 ST)进行比较。结果显示下游集成方式至关重要。我们观察到在端到端 ASR 系统微调前使用性别特定预训练时总体性能较低。然而,当自监督模型用作特征提取器时,总体 ASR 和 ST 结果遵循更复杂的模式,其中平衡预训练模型未必带来最佳结果。最后,我们粗略的“公平性”指标,即女性与男性测试集间测得的相对性能差异,在平衡到性别特定的预训练 wav2vec 2.0 模型之间未表现出强烈变化。

关键词

引用

@article{arxiv.2204.01397,
  title  = {A Study of Gender Impact in Self-supervised Models for Speech-to-Text Systems},
  author = {Marcely Zanon Boito and Laurent Besacier and Natalia Tomashenko and Yannick Estève},
  journal= {arXiv preprint arXiv:2204.01397},
  year   = {2022}
}

备注

Accepted to INTERSPEECH 2022 (Special session Inclusive and Fair Speech Technologies)