中文

通过学习视点 Token 实现文本到图像生成中的相机控制

计算机视觉与模式识别 2026-04-23 v1

摘要

当前的文本到图像模型难以仅使用自然语言实现精确的相机控制。在本工作中,我们提出了一个框架,通过学习参数化相机 Token,在文本到图像生成中实现具有全局场景理解的精确相机控制。我们在一个精心策划的数据集上对图像生成模型进行微调,以实现视点条件的文本到图像生成,该数据集结合了用于几何监督的 3D 渲染图像和用于外观与背景多样性的照片级真实感增强。定性和定量实验表明,我们的方法在保持图像质量和提示保真度的同时,实现了 SOTA 的准确度。与之前过拟合于特定对象外观相关性的方法不同,我们的视点 Token 学习了可分解的几何表示,能够迁移至未见过的对象类别。我们的工作表明,文本-视觉潜在空间可以赋予显式的 3D 相机结构,为文本到图像生成提供了一条通向几何感知提示的路径。项目页面:https://randdl.github.io/viewtoken_control/

关键词

引用

@article{arxiv.2604.19954,
  title  = {Camera Control for Text-to-Image Generation via Learning Viewpoint Tokens},
  author = {Xinxuan Lu and Charless Fowlkes and Alexander C. Berg},
  journal= {arXiv preprint arXiv:2604.19954},
  year   = {2026}
}