LEMaRT:用于图像调和的标签高效掩码区域变换
计算机视觉与模式识别
2023-04-27 v1
摘要
我们提出了一种简单而有效的图像调和自监督预训练方法,可利用大规模无标注图像数据集。为实现该目标,我们首先通过标签高效掩码区域变换(LEMaRT)流水线在线生成预训练数据。给定一幅图像,LEMaRT 生成前景掩码,然后对由所生成掩码指定的区域施加一组变换以扰动多种视觉属性,例如散焦模糊、对比度、饱和度。随后我们通过从扰动图像恢复原始图像来预训练图像调和模型。其次,我们引入一种图像调和模型,即 SwinIH,通过将 Swin Transformer [27] 改造为局部与全局自注意力机制的组合。使用 LEMaRT 预训练 SwinIH 在图像调和上取得了新的最优结果,同时具有标签高效性,即微调所需的标注数据少于现有方法。值得注意的是,在 iHarmony4 数据集 [8] 上,当仅使用 50% 训练数据微调时,SwinIH 以 0.4 dB 的优势超越最优方法 SCS-Co [16];当使用全部训练数据集训练时,优势达 1.0 dB。
引用
@article{arxiv.2304.13166,
title = {LEMaRT: Label-Efficient Masked Region Transform for Image Harmonization},
author = {Sheng Liu and Cong Phuoc Huynh and Cong Chen and Maxim Arap and Raffay Hamid},
journal= {arXiv preprint arXiv:2304.13166},
year = {2023}
}
备注
Accepted by CVPR'23, 19 pages