中文

基于多模态大基础模型的歌唱音色流行度评估

声音 2025-12-09 v1 人工智能

摘要

自动歌唱评估对教育和娱乐至关重要。然而,现有系统面临两个基本局限:对参考曲目的依赖抑制了创造性表达,以及将复杂表演简化为仅基于音高和节奏的非诊断性分数。我们倡导从判别式评估转向描述式评估,创建一个完整的参考自由、多维评估生态系统。首先,我们引入了 Sing-MD,一个由专家在四个维度上标注的大规模数据集:呼吸控制、音色质量、情感表达和声乐技巧。我们的分析揭示了专家之间显著的标注不一致性,挑战了传统基于准确率的指标的有效性。其次,针对多模态大语言模型(MLLM)在分析完整歌曲时的内存限制,我们提出了 VocalVerse。这一高效混合架构利用轻量级声学编码器来建模全局表演特征和长期依赖关系。第三,针对自动指标的不足,我们建立了 H-TPR(Human-in-the-loop Tiered Perceptual Ranking)基准,评估模型生成感知有效排序的能力,而非预测噪声地面真值分数。

关键词

引用

@article{arxiv.2512.06999,
  title  = {Singing Timbre Popularity Assessment Based on Multimodal Large Foundation Model},
  author = {Zihao Wang and Ruibin Yuan and Ziqi Geng and Hengjia Li and Xingwei Qu and Xinyi Li and Songye Chen and Haoying Fu and Roger B. Dannenberg and Kejun Zhang},
  journal= {arXiv preprint arXiv:2512.06999},
  year   = {2025}
}

备注

Accepted to ACMMM 2025 oral