中文

通过反记忆引导缓解文本到音频生成扩散模型中的数据复制问题

音频与语音处理 2026-01-30 v2 机器学习 声音 信号处理

摘要

生成式音频模型中的数据复制是一个持续存在的挑战,即模型在推理过程中不慎生成其训练数据的部分内容。本文通过探索反记忆策略来解决此问题,针对文本到音频扩散模型提出反记忆引导(Anti-Memorization Guidance,简称 AMG)技术。该技术修改了预训练扩散模型的采样过程,以抑制记忆现象。我们的研究探索了 AMG 中的三种类型的引导,每种引导旨在减少复制行为,同时保持生成质量。我们采用 Stable Audio Open 作为底层模型,利用其完全开源的架构和训练数据集。我们的综合实验分析表明,AMG 在不损害音频保真度或语义对齐度的前提下,显著缓解了基于扩散的文本到音频生成中的记忆现象。

关键词

引用

@article{arxiv.2509.14934,
  title  = {Mitigating data replication in text-to-audio generative diffusion models through anti-memorization guidance},
  author = {Francisco Messina and Francesca Ronchini and Luca Comanducci and Paolo Bestagini and Fabio Antonacci},
  journal= {arXiv preprint arXiv:2509.14934},
  year   = {2026}
}

备注

Accepted at ICASSP 2026