PortraitCraft: 人物构图理解与生成基准
计算机视觉与模式识别
2026-04-17 v2
摘要
人物构图在人物审美和视觉传达中占据核心位置,但现有数据集和基准主要关注粗糙的审美评分、通用图像审美或不受约束的人物生成。这限制了系统性研究结构化人物构图分析和在明确构图要求下的可控人物生成。本文引入 PortraitCraft,一个统一的人物构图理解与生成基准。PortraitCraft 基于约 5 万张精选真实人物图像构建,包含结构化的多级监督信息,包括全局构图评分、13 项构图属性的注释、属性级别解释文本、视觉问答配对以及面向构图的文本描述。基于此数据集,我们在统一框架内建立两个互补的基准任务,用于构图理解和构图感知生成。第一个通过评分预测、精细属性推理和图像关联视觉问答评估人物构图理解,第二个则在明确构图约束下从结构化构图描述生成人物。我们进一步定义了标准化评估协议,并提供了代表性多模态模型的参考基线结果。PortraitCraft 为未来研究在细粒度人物理解、可解释审美评估和可控人物生成提供了全面基准。
引用
@article{arxiv.2604.03611,
title = {PortraitCraft: A Benchmark for Portrait Composition Understanding and Generation},
author = {Yuyang Sha and Zijie Lou and Youyun Tang and Xiaochao Qu and Zheng Qu and Ben Xia and Haoxiang Li and Ting Liu and Luoqi Liu},
journal= {arXiv preprint arXiv:2604.03611},
year = {2026}
}