面向用户生成内容的空间 - 语义协同裁剪
计算机视觉与模式识别
2024-01-17 v1
摘要
大量用户生成内容 (UGC) 每天被上传至互联网,并通过客户端(如移动设备和 PC)向全球用户展示。这要求裁剪算法能够在不同设备上以特定纵横比生成美观的缩略图。然而,现有的图像裁剪工作主要集中于地标或风景图像,未能对 UGC 中复杂背景下的多对象关系进行建模。此外,以往的方法仅考虑裁剪图像的美观性,而忽略了对于 UGC 裁剪至关重要的内容完整性。在本文中,我们提出了一种用于任意用户生成内容的空间 - 语义协同裁剪网络 (S2CNet),并配套提出了一个新的裁剪基准。具体而言,我们首先挖掘潜在对象的视觉基因。随后,建议的自适应注意力图将此任务重构为视觉节点上的信息关联过程。潜在的空间和语义关系最终通过可微消息传递集中到裁剪候选区域,这有助于我们的网络有效地保持美观性和内容完整性。在提出的 UGCrop5K 和其他公共数据集上的大量实验证明,我们的方法优于最先进的同类方法。我们的项目地址为 https://github.com/suyukun666/S2CNet。
引用
@article{arxiv.2401.08086,
title = {Spatial-Semantic Collaborative Cropping for User Generated Content},
author = {Yukun Su and Yiwen Cao and Jingliang Deng and Fengyun Rao and Qingyao Wu},
journal= {arXiv preprint arXiv:2401.08086},
year = {2024}
}