SocialMirror:从单目视频中重建带语义与几何引导的3D人类互动行为
计算机视觉与模式识别
2026-04-16 v1
摘要
准确重建近距离互动情境中的人类行为对于实现增强现实中的逼真虚拟交互、运动分析中的精确捕捉以及人机任务中的自然协作行为至关重要。可靠的重建显著提升了 AI 驱动的交互式应用的真实性和效果。然而,由于严重的相互遮挡,近距离互动场景下的单目视频人类重建仍面临当地运动歧义、时序连续性被破坏以及空间关系错误等挑战。本文提出了 SocialMirror,一个基于扩散模型的框架,集成语义与几何线索,有效解决上述问题。具体而言,我们首先利用视觉语言模型生成的高层次互动描述,引导语义引导的运动填充器,幻视被遮挡的身体并解决局部姿态歧义。随后,我们提出了序列级时序细化器,以确保运动平滑无抖动,同时在采样过程中融入几何约束,以确保可行的接触和空间关系。实验评估表明,SocialMirror 在重建交互式人类网格图方面实现了最新的性能,展现出强大的跨数据集和野外场景的泛化能力。发布后将公开代码。
引用
@article{arxiv.2604.13581,
title = {SocialMirror: Reconstructing 3D Human Interaction Behaviors from Monocular Videos with Semantic and Geometric Guidance},
author = {Qi Xia and Peishan Cong and Ziyi Wang and Yujing Sun and Qin Sun and Xinge Zhu and Mao Ye and Ruigang Yang and Yuexin Ma},
journal= {arXiv preprint arXiv:2604.13581},
year = {2026}
}