中文

自回归与流匹配:文本到音乐生成建模范式的比较研究

声音 2025-09-05 v3 人工智能 机器学习 音频与语音处理

摘要

文本到音乐生成的近期进展使模型能够合成高质量音乐片段、完整作品,甚至响应细粒度控制信号,例如和弦进行。最先进(SOTA)系统在多个维度上存在显著差异,如训练数据集、建模范式和架构选择。这种多样性使公平评估模型并识别哪些设计选择对性能影响最大变得复杂。虽然数据和架构等因素很重要,但本研究仅聚焦于建模范式。我们进行了系统的实证分析以分离其效应,提供了关于相关权衡和涌现行为的见解,可指导未来的文本到音乐生成系统。具体而言,我们比较了两种最常见的建模范式:自回归解码和条件流匹配。我们通过使用相同的数据集、训练配置和相似骨干架构从头训练所有模型来进行对照比较。性能在多个维度上评估,包括生成质量、对推理配置的鲁棒性、可扩展性、对文本和时间对齐条件的遵循,以及以音频修复形式体现的编辑能力。这项比较研究揭示了每种范式的独特优势与局限,提供了可操作的见解,可为不断发展的文本到音乐生成领域中的未来架构和训练决策提供信息。音频采样示例可在以下网址获取:https://huggingface.co/spaces/ortal1602/ARvsFM

关键词

引用

@article{arxiv.2506.08570,
  title  = {Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation},
  author = {Or Tal and Felix Kreuk and Yossi Adi},
  journal= {arXiv preprint arXiv:2506.08570},
  year   = {2025}
}