面向实时的端到端时空Transformer用于4D人物-物体互动重建
计算机视觉与模式识别
2026-03-17 v1
摘要
单目4D人物-物体互动(HOI)重建——从单个RGB视频中恢复移动的人和操作物体——仍面临深度歧义和频繁遮挡的挑战。现有方法常依赖多阶段管道或迭代优化,导致高推理延迟,难以满足实时需求,且易受误差累积影响。为此,我们提出THO,一个端到端的时空Transformer,从给定视频和3D模板中以前向方式预测人物运动和协调的物体运动。THO通过利用时空HOI元组先验实现这一目标。时空先验利用接触区域的接近性推断被遮挡的物体特征,以人物线索为依据;时序先验捕获跨帧的运动学相关性,以细化物体表征并实现物理一致性。广泛的实验表明,THO在单张RTX 4090 GPU上以31.5 FPS的推理速度运行,实现了对Prior optimization-based方法的>600倍加速,同时在重建精度和时序一致性方面取得显著提升。项目页面可访问:https://nianheng.github.io/THO-project/。
关键词
引用
@article{arxiv.2603.14435,
title = {End-to-End Spatial-Temporal Transformer for Real-time 4D HOI Reconstruction},
author = {Haoyu Zhang and Wei Zhai and Yuhang Yang and Yang Cao and Zheng-Jun Zha},
journal= {arXiv preprint arXiv:2603.14435},
year = {2026}
}
备注
23 pages, 7 figures. The project page is available at: https://nianheng.github.io/THO-project/