中文

AesCrop:由构图引导的审美导向裁切

计算机视觉与模式识别 2025-10-28 v1

摘要

审美导向的图像裁切对于视图推荐和缩略图生成等应用至关重要,因为视觉吸引力显著影响用户参与度。视觉吸引力的关键因素是构图——元素在图像内的精心安排。一些方法成功地通过评估方法和回归方法等 incorporating 构图知识。然而,评估方法缺乏全局性,而回归方法缺乏多样性。最近涌现出集成两者范式的混合方法,弥合了两者之间的差距,以实现更好的多样性和全局性。值得注意的是,现有的混合方法不包含摄影构图指导,这是定义摄影审美的关键属性。在本工作中,我们引入 AesCrop,一种具备构图意识的混合图像裁切模型,集成 VMamba 图像编码器,增强了 novel Mamba Composition Attention Bias (MCAB) 和 transformer 解码器,用于执行端到端基于排名的图像裁切,生成多个裁切结果及其对应的质量分数。通过显式地将构图线索编码到注意力机制中,MCAB 指导 AesCrop 关注最具构图显著性的区域。大量实验表明,AesCrop 在当前最先进的方法之上,在定量指标和定性更令人愉悦的裁切方面均表现出优越性。

关键词

引用

@article{arxiv.2510.22528,
  title  = {AesCrop: Aesthetic-driven Cropping Guided by Composition},
  author = {Yen-Hong Wong and Lai-Kuan Wong},
  journal= {arXiv preprint arXiv:2510.22528},
  year   = {2025}
}

备注

Accepted at the IEEE/CVF International Conference on Computer Vision (ICCV) Workshops, 2025