可靠高效的图像裁剪:一种基于网格锚框的方法
计算机视觉与模式识别
2019-04-10 v1
摘要
图像裁剪旨在通过去除图像中多余的内容来改善其构图与美学质量。现有的图像裁剪数据库仅提供一个人或若干人标注的边界框作为真值,无法反映图像裁剪在实践中具有的非唯一性与灵活性。所采用的诸如交并比等评估指标,同样无法可靠地反映裁剪模型的真实性能。本文重新审视图像裁剪问题,并通过考虑图像裁剪的特殊属性与要求(如局部冗余、内容保留、长宽比)提出了一种基于网格锚框的形式化方法。我们的形式化方法将候选裁剪的搜索空间从数百万减少到不足一百。据此,我们构建了一个基于网格锚框的裁剪基准,其中每幅图像的所有裁剪均被标注,并定义了更可靠的评估指标。我们还设计了一个有效且轻量的网络模块,它同时考虑感兴趣区域与丢弃区域以实现更精确的图像裁剪。我们的模型能够稳定地为不同场景的图像输出视觉上令人满意的裁剪结果,并以 125 FPS 的速度运行。代码与数据集见:https://github.com/HuiZeng/Grid-Anchor-based-Image-Cropping。
引用
@article{arxiv.1904.04441,
title = {Reliable and Efficient Image Cropping: A Grid Anchor based Approach},
author = {Hui Zeng and Lida Li and Zisheng Cao and Lei Zhang},
journal= {arXiv preprint arXiv:1904.04441},
year = {2019}
}
备注
To appear in CVPR 2019. Code and dataset are released