通过向外绘制专业照片学习主体感知裁剪
计算机视觉与模式识别
2024-04-05 v2 图形学
摘要
如何构图(或裁剪)一张照片通常取决于图像主体及其上下文,例如人像。近期工作将主体感知图像裁剪任务定义为图像裁剪的一个精细且实用的版本。我们提出了一种弱监督方法(GenCrop),从专业图库图像中学习什么是高质量的、主体感知的裁剪。与有监督的先前工作不同,GenCrop 不需要超出现有图库图像集合的任何新的人工标注。然而,从这些数据中学习的关键挑战在于图像已经被裁剪过,我们不知道哪些区域被移除了。我们的核心思想是将图库图像与现代预训练的文本到图像扩散模型相结合。图库图像集合提供了多样性,其图像作为良好裁剪的伪标签,而文本到图像扩散模型用于向外绘制(即向外修复)真实的未裁剪图像。使用这一流程,我们能够自动生成大量裁剪-未裁剪训练对数据集来训练裁剪模型。尽管是弱监督的,GenCrop 在定量和定性评估指标上与 SOTA 的有监督方法相当,并显著优于可比的弱监督基线。
引用
@article{arxiv.2312.12080,
title = {Learning Subject-Aware Cropping by Outpainting Professional Photos},
author = {James Hong and Lu Yuan and Michaël Gharbi and Matthew Fisher and Kayvon Fatahalian},
journal= {arXiv preprint arXiv:2312.12080},
year = {2024}
}
备注
AAAI 24. Extended version with supplemental materials