中文

无名鸿沟:音乐生成中的策略感知风格控制

声音 2025-09-03 v1 人工智能 机器学习 多媒体 音频与语音处理

摘要

文本到音乐模型能够捕捉诸如乐器配置或情绪等广泛属性,但细粒度的风格控制仍是一个开放挑战。现有的风格化方法通常需要重新训练或专门的条件输入,这使可复现性复杂化,并在艺术家名称受限时限制了策略合规性。我们研究从大语言模型中采样的轻量级、人类可读的修饰词能否为风格控制提供一种策略稳健的替代方案。使用 MusicGen-small,我们评估了两位艺术家:Billie Eilish(人声流行乐)和 Ludovico Einaudi(器乐钢琴)。对于每位艺术家,我们使用十五个参考片段,并在三种条件下评估匹配的随机种子:基线提示词、艺术家姓名提示词和五个描述符集。所有提示词均使用大语言模型生成。评估使用 VGGish 和 CLAP 嵌入,结合分布级和逐片段相似度度量,包括一种新的最小距离归因指标。结果表明,艺术家姓名是两位艺术家中最强的控制信号,而无名描述符恢复了这一效果的很大一部分。这凸显了现有的防护措施(如限制音乐生成提示词中的艺术家姓名)可能无法完全防止风格模仿。跨艺术家迁移降低了对齐度,表明描述符编码了有针对性的风格线索。我们还展示了十位当代艺术家的描述符表,以说明这些标记的广度。这些发现共同定义了“无名鸿沟”,即艺术家姓名提示词与策略合规描述符之间的可控性差异,并通过一种可复现的提示词级可控性评估协议加以展示。

关键词

引用

@article{arxiv.2509.00654,
  title  = {The Name-Free Gap: Policy-Aware Stylistic Control in Music Generation},
  author = {Ashwin Nagarajan and Hao-Wen Dong},
  journal= {arXiv preprint arXiv:2509.00654},
  year   = {2025}
}

备注

10 pages, 2 figures