H-Flow:基于物理启发的自监督人体场景流多模态联合学习
计算机视觉与模式识别
2026-05-22 v1
摘要
参数化人体模型捕获全局姿态,但无法表示服装和软组织的非刚性表面动力学。通用场景流估计密集运动,但在关节化身体上会失效,像素级监督也难以获得。我们引入 H-Flow,一种捕获人体骨骼运动和表面变形的稠密人体场景流。统一的多头变换器从单目视频中估计流,联合预测姿态和深度作为伴随输出。挑战在于缺乏监督。以不可达的标签形式代替,我们将网络锚定在人体运动的物理学中,将几何、结构和生物力学先验作为跨模态训练目标。我们进一步引入 DynAct4D,一个提供稠密流注释的高保真合成基准,覆盖多样化的受试者、服装和运动。 在标准基准上,H-Flow 在场景流和参数化基准上均取得优异性能,并能零样本推理至野外视频。发布后将发布代码、模型和 DynAct4D 数据集。
引用
@article{arxiv.2605.22629,
title = {H-Flow: Self-supervised Human Scene Flow via Physics-inspired Joint Multi-modal Learning},
author = {Zhanbo Huang and Xiaoming Liu and Yu Kong},
journal= {arXiv preprint arXiv:2605.22629},
year = {2026}
}
备注
19 pages, 7 figures, 4 tables