SoundCTM:面向全频段文本到语音生成的统一评分模型与一致性模型
声音
2025-03-11 v3 机器学习
音频与语音处理
摘要
声音内容创建是多媒体作品(如视频游戏和电影)的必不可少要素,常涉及大量的试错过程,使创作者能够在创作过程中语义化地反映其艺术灵感。最近高质量的基于扩散的文本到语音 (Text-to-Sound, T2S) 生成模型为创作者提供了有价值的工具。然而,这些模型常常面临推理速度慢的限制,给试错过程带来不愉快的负担。虽然现有的T2S蒸馏模型通过1步生成来解决这一限制,但1步生成的样本质量仍不足以满足生产需求。此外,虽然这些蒸馏模型的多步采样可提升样本质量本身,但由于缺乏确定性采样能力,其语义内容会发生变化。为此,我们引入Sound Consistency Trajectory Models (SoundCTM),允许在高质量1步声音生成与通过多步确定性采样获得优越声音质量之间灵活转换。这使创作者能够通过1步生成高效地进行试错,以语义上对齐样本与其意图,并随后通过保持语义内容的确定性多步采样来提升样本质量。为开发SoundCTM,我们重新构建了原本在计算机视觉中提出的CTM训练框架,引入一种新颖的特征距离,用于蒸馏损失。对于生产级生成,我们将模型扩展至10亿可训练参数,使SoundCTM-DiT-1B成为声音社区中第一个实现了高质量1步和多步全频段(44.1kHz)生成的大规模蒸馏模型。
引用
@article{arxiv.2405.18503,
title = {SoundCTM: Unifying Score-based and Consistency Models for Full-band Text-to-Sound Generation},
author = {Koichi Saito and Dongjun Kim and Takashi Shibuya and Chieh-Hsin Lai and Zhi Zhong and Yuhta Takida and Yuki Mitsufuji},
journal= {arXiv preprint arXiv:2405.18503},
year = {2025}
}
备注
Audio samples: https://anonymus-soundctm.github.io/soundctm_iclr/. Codes: https://github.com/sony/soundctm. Checkpoints: https://huggingface.co/Sony/soundctm