中文

ASTAR-NTU解答AudioMOS挑战2025赛道1

声音 2025-07-15 v1 音频与语音处理

摘要

文本到音乐系统的评估受限于收集专家评估成本和获取难度。AudioMOS 2025挑战赛道1旨在自动预测音乐印象(MI)以及提示词与生成音乐作品之间的文本对齐(TA)。本文报告我们的获胜系统,该系统采用双分支架构,分别使用预训练的MuQ和RoBERTa模型作为音频和文本编码器。采用跨注意力机制融合音频和文本表征。训练时,我们将MI和TA预测重新表述为分类任务。为融合MOS评分的序数特性,将 one-hot 标签转换为基于高斯核的软分布。在官方测试集上,采用该方法训练的单一模型实现了MI为0.991、TA为0.952的系统级斯皮尔曼等级相关系数(SRCC),相较于挑战基线,MI SRCC提升21.21%,TA SRCC提升31.47%。

关键词

引用

@article{arxiv.2507.09904,
  title  = {ASTAR-NTU solution to AudioMOS Challenge 2025 Track1},
  author = {Fabian Ritter-Gutierrez and Yi-Cheng Lin and Jui-Chiang Wei and Jeremy H. M. Wong and Nancy F. Chen and Hung-yi Lee},
  journal= {arXiv preprint arXiv:2507.09904},
  year   = {2025}
}

备注

Under Review - Submitted to AudioMOS Challenge 2025 - ASRU 2025