中文

AlignDiT:多模态对齐扩散变换器用于同步语音生成

计算机视觉与模式识别 2025-10-06 v2 人工智能 多媒体

摘要

本文针对多模态到语音生成任务,旨在从多种输入模态(文本、视频和参考音频)合成高质量语音,提出 AlignDiT,一种多模态对齐扩散变换器。该任务因其在电影制作、配音和虚拟形象等广泛应用而受到关注。尽管近期研究取得了进展,但现有方法仍在语音可理解性、音视频同步、语音自然性和与参考说话者的语音相似性方面存在局限。为此,我们提出 AlignDiT,通过对齐的多模态输入生成准确、同步且自然的语音。基于 DiT 架构的上下文学习能力,AlignDiT 探索了三种有效的多模态对齐策略。此外,我们引入一种新颖的多模态无分类引导机制,使模型能够在语音合成期间自适应地平衡来自每个模态的信息。大量实验表明,AlignDiT 在多个基准测试中在质量、同步和说话人相似性方面显著优于现有方法。此外,AlignDiT 在各种多模态任务(如视频到语音合成和视觉强制对齐)上表现出强大的泛化能力,始终实现最先进的性能。演示页面可在 https://mm.kaist.ac.kr/projects/AlignDiT 查看。

关键词

引用

@article{arxiv.2504.20629,
  title  = {AlignDiT: Multimodal Aligned Diffusion Transformer for Synchronized Speech Generation},
  author = {Jeongsoo Choi and Ji-Hoon Kim and Kim Sung-Bin and Tae-Hyun Oh and Joon Son Chung},
  journal= {arXiv preprint arXiv:2504.20629},
  year   = {2025}
}

备注

ACM Multimedia 2025