中文

从帧到序列:面向人类中心的时序一致稠密预测

计算机视觉与模式识别 2026-02-04 v2

摘要

本文聚焦视频序列中人类中心稠密预测的时序一致性挑战。现有模型在单帧准确率优异,但在运动、遮挡和光照变化下常出现 Flicker,且极少有配对的人类视频监督用于多个稠密任务。我们通过可扩展的合成数据管道解决这一问题,生成光照逼真的人类帧和运动对齐的序列,提供像素级深度、法线和掩码。不同于以往静态数据管道,本管道同时提供帧级标签支持空间学习和序列级监督支持时序学习。基于此,我们训练统一的ViT稠密预测器:(i) 通过 CSE 嵌入注入显式人类几何先验;(ii) 在特征融合后引入轻量级通道重加权模块提升几何特征可靠性。我们的两阶段训练策略(静态预训练 + 动态序列监督),使模型首先获取鲁棒的空间表征,再跨运动对齐序列细化时序一致性。大量实验表明,我们在 THuman2.1 和 Hi4D 上实现最先进性能,并对野生视频有效泛化。

关键词

引用

@article{arxiv.2602.01661,
  title  = {From Frames to Sequences: Temporally Consistent Human-Centric Dense Prediction},
  author = {Xingyu Miao and Junting Dong and Qin Zhao and Yuhang Yang and Junhao Chen and Yang Long},
  journal= {arXiv preprint arXiv:2602.01661},
  year   = {2026}
}