中文

基于三元损失与自监督嵌入的感知音频美学评估改进

音频与语音处理 2025-09-04 v1 机器学习 声音

摘要

我们提出了一种用于生成式音频自动多轴感知质量预测的系统,该系统是为AudioMOS挑战赛2025赛道2开发的。任务是为文本转语音(TTS)、文本转音频(TTA)和文本转音乐(TTM)系统生成的音频预测四个音频美学分数:制作质量、制作复杂度、内容愉悦度和内容实用性。主要挑战在于自然训练数据与合成评估数据之间的领域偏移。为解决这一问题,我们将BEATs——一个预训练的基于Transformer的音频表示模型——与多分支长短期记忆(LSTM)预测器相结合,并使用基于缓冲区的三元损失来按感知相似性结构化嵌入空间。我们的结果表明,这提高了嵌入的可区分性和泛化能力,实现了无需合成训练数据的领域鲁棒音频质量评估。

关键词

引用

@article{arxiv.2509.03292,
  title  = {Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings},
  author = {Dyah A. M. G. Wisnu and Ryandhimas E. Zezario and Stefano Rini and Hsin-Min Wang and Yu Tsao},
  journal= {arXiv preprint arXiv:2509.03292},
  year   = {2025}
}

备注

Accepted by IEEE Automatic Speech Recognition and Understanding Workshop(ASRU), 2025