中文

AudioBERTScore: 基于音频嵌入序列相似性的环境声合成客观评估指标

声音 2025-07-02 v1 音频与语音处理

摘要

我们提出了一种用于文本到音频(TTA)合成音频的客观评估指标,以提高TTA模型的性能。TTA中,合成声音的主观评估是重要但需要经济成本的实现方式。因此,常用 mel-cepstral distortion 等客观评估指标,但这些客观指标与主观评估值之间的相关性较弱。我们提出的客观评估指标AudioBERTScore计算合成声与参考声的嵌入相似性。该方法不仅基于常规BERTScore中的最大范数,还使用 pp-norm 以反映环境声的非局部性。实验结果表明,所提出方法获得的分数与主观评估值之间的相关性高于常规指标。

关键词

引用

@article{arxiv.2507.00475,
  title  = {AudioBERTScore: Objective Evaluation of Environmental Sound Synthesis Based on Similarity of Audio embedding Sequences},
  author = {Minoru Kishi and Ryosuke Sakai and Shinnosuke Takamichi and Yusuke Kanamori and Yuki Okamoto},
  journal= {arXiv preprint arXiv:2507.00475},
  year   = {2025}
}