中文

OmniShow:统一多模态条件下的人物-物体互动视频生成

计算机视觉与模式识别 2026-04-20 v2

摘要

本文研究了人物-物体互动视频生成(Human-Object Interaction Video Generation, HOIVG),旨在基于文本、参考图像、音频和姿态条件合成高质量的人物-物体互动视频。该任务在电商演示、短视频制作和交互式娱乐等实际应用场景中具有重要的实际价值。然而,现有方法无法满足所有这些必需条件。我们提出了OmniShow,一个为此实际且具挑战性的任务量身定制的端到端框架,能够融合多模态条件并交付行业级性能。为解决可控性与质量之间的权衡,我们引入了统一通道级条件(Unified Channel-wise Conditioning)以高效注入图像和姿态,并通过门控局部语境注意力(Gated Local-Context Attention)确保音视频同步精确。为有效应对数据稀缺问题,我们开发了解耦-再联合训练策略(Decoupled-Then-Joint Training),采用多阶段训练过程结合模型融合,高效利用异构子任务数据集。此外,为填补该领域评估空白,我们建立了HOIVG-Bench,一个专注且全面的HOIVG基准。大量实验表明,OmniShow在各种多模态条件设置下均实现了总体最先进的性能,为新兴的HOIVG任务树立了坚实的标准。

关键词

引用

@article{arxiv.2604.11804,
  title  = {OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation},
  author = {Donghao Zhou and Guisheng Liu and Hao Yang and Jiatong Li and Jingyu Lin and Xiaohu Huang and Yichen Liu and Xin Gao and Cunjian Chen and Shilei Wen and Chi-Wing Fu and Pheng-Ann Heng},
  journal= {arXiv preprint arXiv:2604.11804},
  year   = {2026}
}

备注

Project page: https://correr-zhou.github.io/OmniShow/