中文

SpeechBERTScore:利用 NLP 评估指标的参考感知语音生成自动评估

声音 2024-09-04 v3 音频与语音处理

摘要

尽管主观评估一直是评价语音生成的金标准,但由于其成本效益,人们越来越需要与人类主观判断高度相关的客观指标。本文受自然语言处理中评估指标的启发,提出了参考感知的语音生成自动评估方法。所提出的 SpeechBERTScore 为生成语音和参考语音的自监督密集语音特征计算 BERTScore,这些特征可以具有不同的序列长度。我们还提出了基于语音离散 token 计算的 SpeechBLEU 和 SpeechTokenDistance。对合成语音的评估表明,我们的方法比梅尔倒谱失真和最近的均值意见分预测模型与人类主观评分具有更好的相关性。此外,它们在噪声语音评估中有效,并具有跨语言适用性。

关键词

引用

@article{arxiv.2401.16812,
  title  = {SpeechBERTScore: Reference-Aware Automatic Evaluation of Speech Generation Leveraging NLP Evaluation Metrics},
  author = {Takaaki Saeki and Soumi Maiti and Shinnosuke Takamichi and Shinji Watanabe and Hiroshi Saruwatari},
  journal= {arXiv preprint arXiv:2401.16812},
  year   = {2024}
}

备注

Accepted by Interspeech 2024. An extended version with Appendix. Code: https://github.com/Takaaki-Saeki/DiscreteSpeechMetrics