中文

PhotoFramer:多模态图像构图指令

计算机视觉与模式识别 2026-04-22 v2

摘要

构图在拍照过程中至关重要, 但许多 casual users struggle to frame well-composed images。 为提供构图指导, 我们提出 PhotoFramer, 一个多模态构图指令框架。 给定劣质构图图像, PhotoFramer 首先以自然语言描述改进构图的方法, 然后生成优质构图示例图像。为训练此类模型, 我们构建了大规模数据集。灵感来自人类拍照方式, 将构图指导组织为子任务层级:平移、缩放和视角变更任务。平移和缩放数据来自现有裁剪数据集, 视角变更数据通过两个阶段管道获取。首先, 从多视角数据集中抽取视点不同的图像对, 训练退化模型将优质构图照片转化为劣质构图图像;其次, 将此退化模型应用于专家拍摄的照片, 生成劣质图像以形成训练对。使用该数据集, 我们微调一个同时处理和生成文本与图像的模型, 实现可操作的文本指导并配以示例图像。广泛实验表明, 文本指令有效引导图像构图, 将其与示例图像耦合可显著优于仅用示例图像的基线方法。PhotoFramer 为构图助手提供了实用方案, 让专家摄影先验更易被日常用户所掌握。

关键词

引用

@article{arxiv.2512.00993,
  title  = {PhotoFramer: Multi-modal Image Composition Instruction},
  author = {Zhiyuan You and Ke Wang and He Zhang and Xin Cai and Jinjin Gu and Tianfan Xue and Chao Dong and Zhoutong Zhang},
  journal= {arXiv preprint arXiv:2512.00993},
  year   = {2026}
}

备注

Accepted by CVPR 2026