基于多音轨注意力与分层不确定性建模的歌曲美学评价
声音
2026-01-21 v1 多媒体
音频与语音处理
摘要
音乐生成人工智能 (AI) 正在迅速扩展音乐内容,这使得自动化的歌曲美学评价成为必要。然而,现有研究主要集中在语音、音频或演唱质量上,对歌曲美学的探索尚不充分。此外,传统方法通常直接预测一个精确的平均意见得分 (MOS) 值,这难以捕捉歌曲美学评价中人类感知的细微差别。本文提出了一种面向歌曲的美学评价框架,其包含两个新颖模块:1) 多音轨注意力融合 (MSAF) 在混音-人声和混音-伴奏对之间构建双向交叉注意力,将它们融合以捕获复杂的音乐特征;2) 分层粒度感知区间聚合 (HiGIA) 学习多粒度的分数概率分布,将其聚合为一个分数区间,并在该区间内应用回归以产生最终分数。我们在两个完整歌曲数据集上进行了评估:SongEval 数据集(AI 生成)和一个内部美学数据集(人类创作),并与两个最先进 (SOTA) 模型进行了比较。结果表明,所提出的方法在多维歌曲美学评价中取得了更强的性能。
引用
@article{arxiv.2601.12222,
title = {Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling},
author = {Yishan Lv and Jing Luo and Boyuan Ju and Yang Zhang and Xinda Wu and Bo Yuan and Xinyu Yang},
journal= {arXiv preprint arXiv:2601.12222},
year = {2026}
}