中文

Mix2Morph:从含噪混合中学习声音变形

声音 2026-01-29 v1

摘要

我们提出 Mix2Morph,一种文本到音频扩散模型,经过微调以执行声音变形,无需专用的变形数据集。通过在更高扩散时间步长上对含噪替代混合进行微调,Mix2Morph 产生稳定、感知连贯的变形,令人信服地融合了两种源声音的特性。我们特别针对声音注入,这是变形中一个基于实践和感知的亚类,其中一个声音作为主导主源,提供整体时间和结构行为,而第二个声音被注入其中,丰富其音色和纹理品质。客观评估和听力测试表明,Mix2Morph 优于先前的基线,并在不同类别中产生高质量的声音注入,这代表了向更可控和概念驱动的声音设计工具迈出的一步。声音示例可在 https://anniejchu.github.io/mix2morph 获取。

关键词

引用

@article{arxiv.2601.20426,
  title  = {Mix2Morph: Learning Sound Morphing from Noisy Mixes},
  author = {Annie Chu and Hugo Flores García and Oriol Nieto and Justin Salamon and Bryan Pardo and Prem Seetharaman},
  journal= {arXiv preprint arXiv:2601.20426},
  year   = {2026}
}

备注

Accepted into ICASSP 2026