中文

WhisQ:文本到音乐 MOS 预测的跨模态表征学习

声音 2025-06-09 v1 人工智能 音频与语音处理

摘要

文本到音乐系统的平均意见分数(MOS)预测要求评估整体音乐质量和文本提示对齐程度。本文介绍WhisQ,这是一种多模态架构,通过序列级协注意力和最优传输正则化来解决这一双重评估挑战。WhisQ采用预训练的Whisper Base模型进行时间频域音频编码,采用0.6B规模的小型语言模型(SLM)Qwen 3进行文本编码,两者保持序列结构以进行细粒度的跨模态建模。该架构具有专门的预测路径:OMQ由池化后的音频嵌入预测,而TA利用音频和文本之间的双向序列协注意力。此外,Sinkhorn最优传输损失进一步强制共享嵌入空间中的语义对齐。在MusicEval Track-1数据集上,WhisQ相对于基线模型实现了显著的性能提升:OMQ的Spearman相关系数提升了7%,TA提升了14%。消融研究表明,最优传输正则化提供了最大的性能提升(10%的SRCC提升),这表明了对于文本到音乐评估,显式的跨模态对齐至关重要。

关键词

引用

@article{arxiv.2506.05899,
  title  = {WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction},
  author = {Jakaria Islam Emon and Kazi Tamanna Alam and Md. Abu Salek},
  journal= {arXiv preprint arXiv:2506.05899},
  year   = {2025}
}

备注

3 pages