中文

CAMEO: 多视角扩散模型中的对应-注意力对齐

计算机视觉与模式识别 2025-12-03 v1

摘要

多视角扩散模型近期作为一种强大的新视角合成范式出现,但其实现视角一致性的底层机制仍不明确。在这项工作中,我们首先验证了这些模型的注意力图在训练过程中获取了几何对应,在参考视图和目标视图之间关注几何对应的区域以实现视角一致的生成。然而,这一对应信号仍然不完整,在大视角变化下其准确性会降低。基于这些发现,我们引入了 CAMEO,一种简单而有效的训练技术,直接使用几何对应来监督注意力图,从而增强多视角扩散模型的训练效率和生成质量。值得注意的是,监督单个注意力层就足以引导模型学习精确的对应,从而保留参考图像的几何和结构,加速收敛,并改善新视角合成性能。CAMEO 将收敛所需的训练迭代次数减少了一半,同时在相同迭代次数下实现了更优性能。我们进一步证明 CAMEO 是模型无关的,可以应用于任何多视角扩散模型。

关键词

引用

@article{arxiv.2512.03045,
  title  = {CAMEO: Correspondence-Attention Alignment for Multi-View Diffusion Models},
  author = {Minkyung Kwon and Jinhyeok Choi and Jiho Park and Seonghu Jeon and Jinhyuk Jang and Junyoung Seo and Minseop Kwak and Jin-Hwa Kim and Seungryong Kim},
  journal= {arXiv preprint arXiv:2512.03045},
  year   = {2025}
}

备注

Project page: https://cvlab-kaist.github.io/CAMEO/