中文

ConfCtrl:基于置信感知插值的视频扩散模型相机控制方法

计算机视觉与模式识别 2026-03-11 v1

摘要

我们解决了在大视角变化下仅凭两张输入图像进行新视角合成的挑战。现有回归方法缺乏重建不可见区域的能力,而相机引导的扩散模型因点云投影噪声或视角姿态条件不足常偏离预期轨迹。为此,我们提出ConfCtrl——一种置信感知视频插值框架,使扩散模型能遵循指定相机姿态,同时完成不可见区域的重构。ConfCtrl通过置信加权的投影点云潜在表示与噪声组合作为条件输入初始化扩散过程,然后应用卡尔曼式预测-更新机制,将投影点云视为噪声测量,并利用学习残差校正平衡由姿态驱动的预测与噪声几何观测之间的可靠性,从而在可靠投影上工作,同时降低不确定区域的权重,实现几何感知的稳定生成。实验表明,ConfCtrl在多个数据集上生成几何一致且视觉上合理的新视角,有效重建大视角变化下的遮挡区域。

关键词

引用

@article{arxiv.2603.09819,
  title  = {ConfCtrl: Enabling Precise Camera Control in Video Diffusion via Confidence-Aware Interpolation},
  author = {Liudi Yang and George Eskandar and Fengyi Shen and Mohammad Altillawi and Yang Bai and Chi Zhang and Ziyuan Liu and Abhinav Valada},
  journal= {arXiv preprint arXiv:2603.09819},
  year   = {2026}
}

备注

13 pages