中文

HEAR:层次化增强的多维音乐审美表示

声音 2026-01-01 v2 人工智能 音频与语音处理

摘要

由于音乐感知的多维特性以及标注数据稀缺,评估歌曲的审美性是一个具有挑战性的任务。我们提出 HEAR,一个稳健的音乐审美评估框架,结合:(1) 多来源多尺度表示模块以获取互补的片段和曲目级别特征,(2) 层次化数据增强策略以缓解过拟合,以及 (3) 集成回归和排序损失的混合训练目标,以实现准确评分和可靠的上层歌曲识别。实验表明,HEAR 在 ICASSP 2026 SongEval 基准测试的两个轨道上,在所有指标上均 consistently 优于基线方法。代码和训练好的模型权重可在 https://github.com/Eps-Acoustic-Revolution-Lab/EAR_HEAR 获取。

关键词

引用

@article{arxiv.2511.18869,
  title  = {Hear: Hierarchically Enhanced Aesthetic Representations For Multidimensional Music Evaluation},
  author = {Shuyang Liu and Yuan Jin and Rui Lin and Shizhe Chen and Junyu Dai and Tao Jiang},
  journal= {arXiv preprint arXiv:2511.18869},
  year   = {2026}
}