VoiceDiT:面向环境感知语音合成的双条件扩散Transformer
音频与语音处理
2024-12-30 v1 声音
摘要
我们提出VoiceDiT,一个多模态生成模型,用于从文本和视觉提示生成环境感知语音和音频。虽然将语音与文本对齐对于可理解的语音合成至关重要,但在噪声环境下实现此对齐仍是该领域面临的重大且尚未充分探索的挑战。为此,我们提出了名为VoiceDiT的新型音频生成管线。该管线包括三个关键组件:(1) 大规模合成语音数据集用于预训练和精炼的真实世界语音数据集用于微调;(2) Dual-DiT模型,用于高效保留对齐语音信息的同时准确反映环境条件;(3)基于扩散的图像到音频翻译器,允许模型在音频与图像之间建立桥梁,促进环境声音的生成,使其与多模态提示相吻合。大量实验结果表明,VoiceDiT在真实世界数据集上超越了先前模型,在音频质量和模态集成方面实现了显著提升。
关键词
引用
@article{arxiv.2412.19259,
title = {VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis},
author = {Jaemin Jung and Junseok Ahn and Chaeyoung Jung and Tan Dat Nguyen and Youngjoon Jang and Joon Son Chung},
journal= {arXiv preprint arXiv:2412.19259},
year = {2024}
}
备注
Accepted to ICASSP 2025