基于生成先验的可控人中心关键帧插值
计算机视觉与模式识别
2026-01-01 v2
摘要
现有插值方法使用预训练的视频扩散先验在稀疏采样的关键帧之间生成中间帧。在缺乏 3D 几何引导的情况下,这些方法难以对复杂的人体关节运动产生合理结果,并且对合成动力学的控制有限。在本文中,我们引入了 PoseFuse3D 关键帧插值器(PoseFuse3D-KI),一种将 3D 人体引导信号整合到扩散过程中的新型框架,用于可控人中心关键帧插值(CHKI)。为了为插值提供丰富的空间和结构线索,我们的 PoseFuse3D(一种 3D 感知控制模型)具有一种新颖的 SMPL-X 编码器,可将 3D 几何和形状转换为 2D 潜在条件空间,以及一个融合网络,将这些 3D 线索与 2D 姿态嵌入整合。为了评估,我们构建了 CHKI-Video,一个同时标注了 2D 姿态和 3D SMPL-X 参数的新数据集。我们表明 PoseFuse3D-KI 在 CHKI-Video 上持续超越最先进基线,PSNR 提升 9%,LPIPS 降低 38%。全面的消融实验证明我们的 PoseFuse3D 模型提升了插值保真度。
引用
@article{arxiv.2506.03119,
title = {Controllable Human-centric Keyframe Interpolation with Generative Prior},
author = {Zujin Guo and Size Wu and Zhongang Cai and Wei Li and Chen Change Loy},
journal= {arXiv preprint arXiv:2506.03119},
year = {2026}
}
备注
Project Page: https://gseancdat.github.io/projects/PoseFuse3D_KI