CoInteract:基于空间结构化协同生成的物理一致人-物交互视频合成
计算机视觉与模式识别
2026-04-22 v1
摘要
合成人-物交互(HOI)视频在电子商务、数字广告和虚拟营销中具有广泛的实用价值。然而,当前的扩散模型尽管具备照片级真实感渲染能力,但仍然频繁在以下方面失败: 手部和面部等敏感区域的结构稳定性,以及 物理合理的接触(例如,避免手与物体相互穿透)。我们提出了 CoInteract,一种以人物参考图像、产品参考图像、文本提示和语音音频为条件的端到端 HOI 视频合成框架。CoInteract 引入了两种嵌入 Diffusion Transformer(DiT)骨干网络的互补设计。首先,我们提出了一种人类感知混合专家,通过空间监督路由将 token 路由至轻量级的区域专用专家,以最小的参数开销提升了细粒度的结构保真度。其次,我们提出了空间结构化协同生成,这是一种双流训练范式,联合建模 RGB 外观流和辅助 HOI 结构流,以注入交互几何先验。在训练期间,HOI 流关注 RGB token,其监督对共享骨干权重进行正则化;在推理期间,移除 HOI 分支以实现零开销 RGB 生成。实验结果表明,CoInteract 在结构稳定性、逻辑一致性和交互真实感方面显著优于现有方法。
引用
@article{arxiv.2604.19636,
title = {CoInteract: Physically-Consistent Human-Object Interaction Video Synthesis via Spatially-Structured Co-Generation},
author = {Xiangyang Luo and Xiaozhe Xin and Tao Feng and Xu Guo and Meiguang Jin and Junfeng Ma},
journal= {arXiv preprint arXiv:2604.19636},
year = {2026}
}
备注
The project page: https://xinxiaozhe12345.github.io/CoInteract_Project/