中文

DreamID-Omni:面向可控人体相关音视频生成的统一框架

计算机视觉与模式识别 2026-02-13 v1

摘要

近期基础模型的进展彻底改变了联合音视频生成。然而,现有方法通常将人体相关任务(包括基于参考的音视频生成(R2AV)、视频编辑(RV2AV)和音驱动视频动画(RA2V))视为孤立目标。此外,在单一框架内实现对多个角色身份和语音 timbre 的精确、解耦控制仍是开放挑战。本文提出 DreamID-Omni,一个面向可控人体相关音视频生成的统一框架。具体而言,我们设计了对称条件扩散变换器,通过对称条件注入方案整合异构条件信号。为解决多人场景中身份-声纹绑定失败和说话人混淆问题,我们引入双层解耦策略:通过同步 RoPE 实现信号层面的刚性注意力空间绑定,通过结构化描述实现语义层面的显式属性-主体映射。此外,我们构建了多任务渐进训练方案,利用弱约束的生成先验正则化强约束任务,防止过拟合并调和不同目标。广泛的实验表明,DreamID-Omni 在视频、音频和音视频一致性方面实现了全面的领先性能,甚至超过了领先的专有商业模型。我们将发布代码,以弥合学术研究与商业级应用之间的差距。

关键词

引用

@article{arxiv.2602.12160,
  title  = {DreamID-Omni: Unified Framework for Controllable Human-Centric Audio-Video Generation},
  author = {Xu Guo and Fulong Ye and Qichao Sun and Liyang Chen and Bingchuan Li and Pengze Zhang and Jiawei Liu and Songtao Zhao and Qian He and Xiangwang Hou},
  journal= {arXiv preprint arXiv:2602.12160},
  year   = {2026}
}

备注

Project: https://guoxu1233.github.io/DreamID-Omni/