中文

OmniCustom: 通过联合音视频生成模型实现同步音视频定制

声音 2026-05-29 v4 人工智能 多媒体 音频与语音处理

摘要

现有的主流视频定制方法侧重于根据给定的参考图像和文本提示生成身份一致的视频。受益于联合音视频生成的快速发展,本文提出了一项更具吸引力的新任务:同步音视频定制,旨在同步定制视频身份和音频音色。具体来说,给定参考图像IrI^{r}和参考音频ArA^{r},这一新任务要求生成在保持参考图像身份的同时模仿参考音频音色的视频,其语音内容可通过用户提供的文本提示自由指定。为此,我们提出了OmniCustom,一个强大的基于DiT的音视频定制框架,能够以零样本方式一次性根据参考图像身份、音频音色和文本提示合成视频。我们的框架建立在三个关键贡献之上。首先,身份和音频音色控制通过独立的参考身份和音频LoRA模块实现,这些模块在基础音视频生成模型的自注意力层内运行。其次,我们引入了对比学习目标以及标准的流匹配目标。它使用以参考输入为条件的预测流作为正例,以无参考条件的预测流作为负例,从而增强模型保持身份和音色的能力。第三,我们在构建的大规模、高质量音视频人类数据集上训练OmniCustom。大量实验表明,OmniCustom在生成具有一致身份和音色保真度的音视频内容方面优于现有方法。项目页面:https://omnicustom-project.github.io/page/。

关键词

引用

@article{arxiv.2602.12304,
  title  = {OmniCustom: Sync Audio-Video Customization Via Joint Audio-Video Generation Model},
  author = {Maomao Li and Zhen Li and Kaipeng Zhang and Guosheng Yin and Zhifeng Li and Dong Xu},
  journal= {arXiv preprint arXiv:2602.12304},
  year   = {2026}
}

备注

code: https://github.com/OmniCustom-project/OmniCustom