中文

基于自监督对比学习多语言模型的自动语音识别无参考质量度量

计算与语言 2023-06-26 v1 音频与语音处理

摘要

自动语音识别(ASR)系统质量评估的通用标准是参考基度量,如词错率(WER),其使用人工真实转写文本计算,获取过程耗时且昂贵。本工作提出一种多语言无参考质量度量,可在无真实转写文本的情况下比较不同 ASR 模型在语音数据集上的性能。为估计 ASR 假设的质量,以自监督学习方式通过对比学习对预训练语言模型(LM)进行微调。在由多种语言中顶级商业 ASR 引擎输出组成的多个未见过测试集上进行的实验中,所提出的无参考度量在所有实验中与 WER 分数及其排序的相关性均远高于最先进多语言 LM 的困惑度度量,并且在用于假设集成时将 WER 降低了超过 7%7\%。为可复现性提供了微调模型与实验:https://github.com/aixplain/NoRefER

关键词

引用

@article{arxiv.2306.13114,
  title  = {A Reference-less Quality Metric for Automatic Speech Recognition via Contrastive-Learning of a Multi-Language Model with Self-Supervision},
  author = {Kamer Ali Yuksel and Thiago Ferreira and Ahmet Gunduz and Mohamed Al-Badrashiny and Golara Javadi},
  journal= {arXiv preprint arXiv:2306.13114},
  year   = {2023}
}

备注

arXiv admin note: substantial text overlap with arXiv:2306.12577