中文

面向相机感知的统一多模态模型:相机中心的理解与生成

计算机视觉与模式识别 2026-03-31 v2

摘要

相机感知的理解与生成是空间智能的两个基石,但通常在孤立的情况下加以研究。我们提出Puffin,一个统一的相机感知多模态模型,扩展了沿相机维度的空间感知能力。Puffin集成了语言回归和基于扩散的生成,以从任意视角解释和创建场景。为弥合相机与视觉语言之间的模态鸿沟,我们引入一种新范例,将相机视为语言,实现“以相机思考”。这指导模型在几何上下文中对齐以摄影术语为语义的空间感知视觉线索。Puffin在由400万张视觉-语言-相机三元组构成的大规模数据集Puffin-4M上进行训练。我们纳入了全局相机参数和像素级相机图,实现灵活可靠的空间生成。实验表明,Puffin在相机感知生成和理解方面优于专门模型。经过指令调谐后,Puffin可推广到各种跨视图任务,如空间想象、世界探索和摄影指导。我们将发布代码、模型、数据集管道和基准,以推动多模态空间智能研究。

关键词

引用

@article{arxiv.2510.08673,
  title  = {Thinking with Camera: A Unified Multimodal Model for Camera-Centric Understanding and Generation},
  author = {Kang Liao and Size Wu and Zhonghua Wu and Linyi Jin and Chao Wang and Yikai Wang and Fei Wang and Wei Li and Chen Change Loy},
  journal= {arXiv preprint arXiv:2510.08673},
  year   = {2026}
}

备注

Accepted by ICLR2026. Project Page: https://kangliao929.github.io/projects/puffin/