自监督摄影图像布局表示学习
计算机视觉与模式识别
2024-08-21 v2 多媒体
摘要
在图像布局表示学习领域,将图像布局转化为简洁向量形式的关键过程在图像检索、操纵和生成等多种应用中日益重要。该领域的大多数方法严重依赖昂贵的标注数据集,且显著缺乏针对摄影图像布局特定细微差别调整其建模和学习方法的能力。这一不足使得摄影图像布局的学习过程次优。在我们的研究中,我们直接解决了这些挑战。我们的创新在于定义了封装各级布局信息的基本布局原语,并将这些原语及其相互关系映射到异构图结构上。该图经过精心设计,旨在显式捕捉像素域内复杂的布局信息。在此基础上,我们引入了新颖的预训练任务及定制的损失函数,专为这些布局图的有效自监督学习而战略设计。基于此基础,我们开发了一种基于自编码器的网络架构,擅长将这些异构图压缩为精确的降维布局表示。此外,我们引入了 LODB 数据集,该数据集具有更广泛的布局类别和丰富的语义,可作为评估布局表示学习方法有效性的综合基准。我们在该数据集上的大量实验证明了我们的方法在摄影图像布局表示学习领域的优越性能。
引用
@article{arxiv.2403.03740,
title = {Self-supervised Photographic Image Layout Representation Learning},
author = {Zhaoran Zhao and Peng Lu and Xujun Peng and Wenhao Guo},
journal= {arXiv preprint arXiv:2403.03740},
year = {2024}
}
备注
The authors of the paper believe that there is an error in the measurement of the F1 curve in the metrics description