适配弗雷歇音频距离用于生成音乐评估
音频与语音处理
2024-03-07 v2
摘要
生成音乐模型日益增长的流行凸显了对感知相关、客观的音乐质量度量指标的需求。弗雷歇音频距离(FAD)常用于此目的,尽管其与感知质量的相关性研究不足。我们表明,FAD性能可能受样本量偏差、音频嵌入选择不当或使用有偏或低质量参考集的阻碍。我们提出通过将对分数向无限样本量外推来减少样本量偏差。通过与MusicCaps标签和听测的比较,我们识别出能产生与声学和音乐质量良好相关的FAD分数的音频嵌入和音乐参考集。我们的结果表明,逐曲FAD可用于识别异常样本并预测一系列音乐集和生成模型的感知质量。最后,我们发布了一个工具包,允许适配FAD用于生成音乐评估。
引用
@article{arxiv.2311.01616,
title = {Adapting Frechet Audio Distance for Generative Music Evaluation},
author = {Azalea Gui and Hannes Gamper and Sebastian Braun and Dimitra Emmanouilidou},
journal= {arXiv preprint arXiv:2311.01616},
year = {2024}
}
备注
Submitted to IEEE ICASSP 2024