中文

基于网格锚点的图像裁剪:一个新基准与高效模型

计算机视觉与模式识别 2019-09-20 v1

摘要

图像裁剪旨在通过移除图像中的多余内容来改善其构图与美学质量。现有的大多数图像裁剪数据库仅提供一个或少数几个人工标注的边界框作为真实值,这很难反映实际中图像裁剪的非唯一性与灵活性。所采用的评估指标(如交并比)也无法可靠地反映裁剪模型的真实性能。本文重新审视了图像裁剪问题,并考虑其特殊性质与要求(如局部冗余、内容保留、宽高比),提出了一种基于网格锚点的形式化方法。我们的方法将候选裁剪框的搜索空间从数百万个减少到不超过九十个。基于此,我们构建了一个基于网格锚点的裁剪基准,其中每张图像的所有裁剪框均被标注,并定义了更可靠的评估指标。为满足鲁棒性能与高效率的实际需求,我们还设计了一个有效且轻量级的裁剪模型。通过同时考虑感兴趣区域与舍弃区域,并利用多尺度信息,我们的模型能够为不同场景的图像稳健地输出视觉上令人愉悦的裁剪结果。该模型参数量不足 250 万,在单块 GTX 1080Ti GPU 上运行速度达 200 FPS,在 i7-6800K CPU 上为 12 FPS。代码见:https://github.com/HuiZeng/Grid-Anchor-based-Image-Cropping-Pytorch。

关键词

引用

@article{arxiv.1909.08989,
  title  = {Grid Anchor based Image Cropping: A New Benchmark and An Efficient Model},
  author = {Hui Zeng and Lida Li and Zisheng Cao and Lei Zhang},
  journal= {arXiv preprint arXiv:1909.08989},
  year   = {2019}
}

备注

Extension of a CVPR 2019 paper. Dataset and PyTorch Code are released. arXiv admin note: substantial text overlap with arXiv:1904.04441