中文

Unison: 调和运动、语音与声音用于人类中心音视频生成

计算机视觉与模式识别 2026-05-12 v1 图形学 多媒体 声音

摘要

运动、语音和声音效果是人类中心视频的基本元素,但其异构的时序特征使得联合生成高度具有挑战性。现有的音视频生成模型常常无法在这些模态之间保持一致的对齐,导致运动、语音和环境声之间出现明显的不匹配。我们提出Unison,一个统一的框架,显式地促进运动、语音和声音模态之间的一致性。在音频流中,Unison采用语义引导的协调策略,将语音和声音效果组件的生成解耦。利用双向音频跨注意力和语义条件化门控进行语义驱动的自适应重构,该方法有效缓解了语音主导问题并增强了声学清晰度。对于音频-运动同步,我们提出一种双向跨模态强制策略,其中较干净的模态通过解耦的去噪计划指导较嘈杂的模态,由渐进的稳定策略进行强化。大量实验表明,Unison在音频感知质量和跨模态同步方面均实现了当前最先进的性能,凸显了在人类中心视频生成中显式多模态协调的重要性。

关键词

引用

@article{arxiv.2605.08729,
  title  = {Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation},
  author = {Shihao Cheng and Jiaxu Zhang and Quanyue Song and Shansong Liu and Zhizhi Guo and Xiaolei Zhang and Chi Zhang and Xuelong Li and Zhigang Tu},
  journal= {arXiv preprint arXiv:2605.08729},
  year   = {2026}
}