中文

SongEcho:基于实例自适应元素线性调制的翻唱生成

声音 2026-02-24 v1

摘要

翻唱是音乐文化中的重要方面, 在原作旋律的基础上进行重新演绎, 以注入新的情感深度和主题强调。尽管先前的研究探索了通过旋律条件化文本到音乐模型对乐器音乐进行重新演绎, 但翻唱生成任务仍基本未被 addresses。本工作将我们的翻唱生成重新表述为条件生成, 同时在原旋律和文本提示的条件下生成新的人声和伴奏。为此,我们提出了 SongEcho, 它利用实例自适应元素线性调制(IA-EiLM), 一个 incorporating 可控生成的框架, 通过改进条件注入机制和条件表示来实现。为增强条件注入机制, 我们将特征线性调制(FiLM)扩展为元素线性调制(EiLM), 以促进旋律控制中的精确时间对齐。对于条件表示, 我们提出了实例自适应条件细化(IACR), 通过与生成模型的隐藏状态相互作用来细化条件特征, 从而实现实例自适应条件。此外, 为解决大规模开源全曲数据集匮乏的问题, 我们构建了 Suno70k, 一个包含全面注释的高质量 AI 歌曲数据集。跨多个数据集的实验结果表明, 我们的方法在生成优于现有方法的翻唱方面表现更好, 而且所需的可训练参数不足于现有方法的 30%。代码、数据集和演示均可在 https://github.com/lsfhuihuiff/SongEcho_ICLR2026 获取。

关键词

引用

@article{arxiv.2602.19976,
  title  = {SongEcho: Towards Cover Song Generation via Instance-Adaptive Element-wise Linear Modulation},
  author = {Sifei Li and Yang Li and Zizhou Wang and Yuxin Zhang and Fuzhang Wu and Oliver Deussen and Tong-Yee Lee and Weiming Dong},
  journal= {arXiv preprint arXiv:2602.19976},
  year   = {2026}
}

备注

Accepted at ICLR 2026. 21 pages (10 pages main text), 5 figures