中文

PreciseCam:面向文本到图像生成的精确相机控制

计算机视觉与模式识别 2025-01-23 v1 人工智能 机器学习

摘要

图像作为一种艺术媒介,通常依赖特定的相机角度和镜头畸变来传达思想或情感;然而,当前的文本到图像模型缺乏这种精确控制。我们提出了一种高效且通用的解决方案,能够在生成摄影图像和艺术图像时对相机进行精确控制。与依赖预定义镜头的现有方法不同,我们仅依赖四个简单的外部和内部相机参数,从而无需现有的几何结构、参考 3D 对象和多视图数据。我们还提供了一个包含超过 57,000 张图像及其文本提示和真实相机参数的新颖数据集。我们的评估表明,在文本到图像生成中实现了精确的相机控制,超越了传统的提示工程方法。我们的数据、模型和代码已在 https://graphics.unizar.es/projects/PreciseCam2024 公开提供。

关键词

引用

@article{arxiv.2501.12910,
  title  = {PreciseCam: Precise Camera Control for Text-to-Image Generation},
  author = {Edurne Bernal-Berdun and Ana Serrano and Belen Masia and Matheus Gadelha and Yannick Hold-Geoffroy and Xin Sun and Diego Gutierrez},
  journal= {arXiv preprint arXiv:2501.12910},
  year   = {2025}
}