中文

OmniTalker:基于多模态风格模仿的一键实时文本驱动说话音视频生成

计算机视觉与模式识别 2025-06-04 v2

摘要

尽管在音频驱动的说话头部生成方面取得了显著进展,但文本驱动的方法仍受到忽视。本文提出了 OmniTalker,一个统一的框架,能够从输入文本生成同步的说话音视频内容,同时模拟目标身份的说话和面部动作风格,包括语音特征、头部运动和面部动态。我们的框架采用双分支扩散变换器(DiT)架构,其中一个分支用于音频生成,另一个用于视频合成。在浅层,引入跨模态融合模块以整合两种模态的信息。在深层,两种模态独立处理,通过声学模型解码生成的音频,通过基于 GAN 的高质量视觉渲染器渲染视频。利用 DiT 通过掩码填充策略的 in-context learning 能力,我们的模型能够同时捕获音频和视觉风格,而无需显式的风格提取模块。得益于 DiT 背板的效率和优化后的视觉渲染器,OmniTalker 能够实现 25 FPS 的实时推理。据我们所知,OmniTalker 是首个能够实时联合建模语音和面部风格的一键框架。广泛的实验表明,OmniTalker 在生成质量方面优于现有方法,尤其在保持风格一致性和确保音视频同步方面表现突出,同时保持高效推理。

关键词

引用

@article{arxiv.2504.02433,
  title  = {OmniTalker: One-shot Real-time Text-Driven Talking Audio-Video Generation With Multimodal Style Mimicking},
  author = {Zhongjian Wang and Peng Zhang and Jinwei Qi and Guangyuan Wang and Chaonan Ji and Sheng Xu and Bang Zhang and Liefeng Bo},
  journal= {arXiv preprint arXiv:2504.02433},
  year   = {2025}
}

备注

Project Page https://humanaigc.github.io/omnitalker