基于互信息引导的扩散声音质感迁移
声音
2026-01-29 v2 人工智能
音频与语音处理
摘要
我们将声音质感迁移作为音频的推理时间编辑问题进行研究。基于强预训练潜在扩散模型,我们引入一种无需额外训练的轻量级程序:(i)在最能指示乐器身份的潜在通道上进行维度级噪声注入;(ii)在逆扩散过程中引入早期步骤的夹紧机制,以重新施加输入的旋律和节奏结构。该方法直接作用于音频潜在表示,兼容文本/音频条件(如CLAP)。我们讨论了设计选择,分析了声音质感变化与结构保持之间的权衡,展示了简单的推理时间控制如何在风格迁移用例中有效地引导预训练模型。
引用
@article{arxiv.2601.01294,
title = {Diffusion Timbre Transfer Via Mutual Information Guided Inpainting},
author = {Ching Ho Lee and Javier Nistal and Stefan Lattner and Marco Pasini and George Fazekas},
journal= {arXiv preprint arXiv:2601.01294},
year = {2026}
}
备注
5 pages, 2 figures, 3 tables