THFM:用于 4D 人体感知及更广泛应用的统一视频基础模型
计算机视觉与模式识别
2026-03-30 v1
摘要
我们提出了 THFM,一个用于以人为中心的感知的统一视频基础模型,在单一架构中联合处理密集任务(深度、法线、分割、密集姿态)和稀疏任务(2D/3D 关键点估计)。THFM 源自一个预训练的文本到视频扩散模型,被重新用作单前向传播感知模型,并通过可学习令牌进行稀疏预测的增强。由文本提示调制,我们的单一统一模型能够执行各种感知任务。关键的是,尽管仅使用合成数据(即未在真实世界或基准特定数据上进行训练),我们的模型在多种基准测试上与最先进的专用模型持平或超越。我们进一步强调了模型有趣的涌现特性,并将其归因于底层的基于扩散的视频表示。例如,在场景中仅包含单个主体的视频上训练的模型可以泛化到多个主体和其他物体类别,如拟人化角色和动物——这一能力在过去尚未被展示过。
引用
@article{arxiv.2603.25892,
title = {THFM: A Unified Video Foundation Model for 4D Human Perception and Beyond},
author = {Letian Wang and Andrei Zanfir and Eduard Gabriel Bazavan and Misha Andriluka and Cristian Sminchisescu},
journal= {arXiv preprint arXiv:2603.25892},
year = {2026}
}