中文

MuSteerNet:基于观察-反应相互引导的人类反应生成

计算机视觉与模式识别 2026-04-21 v2

摘要

视频驱动的人类反应生成旨在合成3D人类动作,直接反应于观察到的视频序列,这对于构建类人交互式AI系统至关重要。然而,现有方法常常未能有效地利用视频输入来引导人类反应合成,导致生成的反应动作与视频序列内容不匹配。我们揭示了这一局限性源于视觉观察与反应类型之间的严重关系失真。鉴于此,我们提出了MuSteerNet,一种简单而有效的框架,通过观察-反应相互引导从视频生成3D人类反应。具体而言,我们首先提出了原型反馈引导机制,通过一个带有门控delta-整形调制器和关系边际约束来缓解关系失真,由从人类反应中学习的原型向量引导。随后,我们引入双耦合反应细化,充分利用校正后的视觉线索进一步引导生成反应动作的细化,从而有效提高反应质量,使MuSteerNet能够实现竞争性能。广泛的实验和消融研究验证了我们方法的有效性。代码即将发布:https://github.com/zhouyuan888888/MuSteerNet

关键词

引用

@article{arxiv.2603.20187,
  title  = {MuSteerNet: Human Reaction Generation from Videos via Observation-Reaction Mutual Steering},
  author = {Yuan Zhou and Yongzhi Li and Yanqi Dai and Xingyu Zhu and Yi Tan and Qingshan Xu and Beier Zhu and Richang Hong and Hanwang Zhang},
  journal= {arXiv preprint arXiv:2603.20187},
  year   = {2026}
}