AImoclips:用于评估文本到音乐生成情感传递的基准
声音
2025-09-05 v2 人工智能
音频与语音处理
摘要
近期文本到音乐(TTM)生成技术的进展,使其能够使用自然语言提示实现可控且富有表现力的音乐创作。然而,TTM 系统在情感忠实度方面的表现,与人类偏好或文本对齐的研究仍较不足。本研究中,我们引入 AImoclips,一个用于评估 TTM 系统将意图情感传递给人类听者的基准,涵盖开源和商业模型。我们选取 12 个情感意图,覆盖价值- arousal 空间的四个象限,并使用六个最先进的 TTM 系统生成超过 1000 个音乐片段。111 名受试者以 9 点likert比例尺对每个片段的感知价值和 arousal 进行评级。我们的结果显示,商业系统倾向于产生被感知为比意图更愉悦的音乐,而开源系统则表现相反。在所有模型下,高 arousal 条件下的情感传递更为准确。此外,所有系统都表现出对情感中性偏见,凸显了情感可控性的关键局限性。这一基准为理解模型特定的情感渲染特征提供了宝贵见解,并支持未来开发情感对齐的 TTM 系统。
引用
@article{arxiv.2509.00813,
title = {AImoclips: A Benchmark for Evaluating Emotion Conveyance in Text-to-Music Generation},
author = {Gyehun Go and Satbyul Han and Ahyeon Choi and Eunjin Choi and Juhan Nam and Jeong Mi Park},
journal= {arXiv preprint arXiv:2509.00813},
year = {2025}
}
备注
to be published in HCMIR25: 3rd Workshop on Human-Centric Music Information Research