迈向小物体编辑:一个基准数据集与一种无训练方法
计算机视觉与模式识别
2024-11-05 v1
摘要
近年来,通过利用大规模基于扩散的生成模型(尤其是Stable Diffusion)的卓越能力,开发了大量文本引导图像编辑方法。尽管扩散模型在生成高质量图像方面取得了成功,由于难以对齐文本与这些物体之间的跨模态注意力图,其在小物体生成方面的应用受到限制。我们的方法提供了一种无训练方法,通过局部和全局注意力引导显著缓解了这一对齐问题,增强了模型根据文本描述准确渲染小物体的能力。我们详细阐述了该方法的方法论,强调其与传统生成技术的差异,并突出其优势。更重要的是,我们还提供了SOEBench(小物体编辑),一个用于定量评估基于文本的小物体生成的标准基准,收集自MSCOCO和OpenImage。初步结果证明了该方法的有效性,显示出与现有模型相比在小物体生成的保真度和准确性方面的显著提升。这一进步不仅为人工智能和计算机视觉领域做出了贡献,还为精确图像生成至关重要的各个行业开辟了新的可能性。我们将在项目页面发布数据集:https://soebench.github.io/。
引用
@article{arxiv.2411.01545,
title = {Towards Small Object Editing: A Benchmark Dataset and A Training-Free Approach},
author = {Qihe Pan and Zhen Zhao and Zicheng Wang and Sifan Long and Yiming Wu and Wei Ji and Haoran Liang and Ronghua Liang},
journal= {arXiv preprint arXiv:2411.01545},
year = {2024}
}
备注
9 pages, 8 figures, Accepted by ACMMM 2024