通过学习视点 Token 实现文本到图像生成中的相机控制
计算机视觉与模式识别
2026-04-23 v1
摘要
当前的文本到图像模型难以仅使用自然语言实现精确的相机控制。在本工作中,我们提出了一个框架,通过学习参数化相机 Token,在文本到图像生成中实现具有全局场景理解的精确相机控制。我们在一个精心策划的数据集上对图像生成模型进行微调,以实现视点条件的文本到图像生成,该数据集结合了用于几何监督的 3D 渲染图像和用于外观与背景多样性的照片级真实感增强。定性和定量实验表明,我们的方法在保持图像质量和提示保真度的同时,实现了 SOTA 的准确度。与之前过拟合于特定对象外观相关性的方法不同,我们的视点 Token 学习了可分解的几何表示,能够迁移至未见过的对象类别。我们的工作表明,文本-视觉潜在空间可以赋予显式的 3D 相机结构,为文本到图像生成提供了一条通向几何感知提示的路径。项目页面:https://randdl.github.io/viewtoken_control/
引用
@article{arxiv.2604.19954,
title = {Camera Control for Text-to-Image Generation via Learning Viewpoint Tokens},
author = {Xinxuan Lu and Charless Fowlkes and Alexander C. Berg},
journal= {arXiv preprint arXiv:2604.19954},
year = {2026}
}