中文

利用大语言模型与布局到图像合成提升少样本检测

计算机视觉与模式识别 2024-10-10 v1

摘要

近期扩散模型的进展使广泛的工作能够利用其生成高质量数据的能力用于各种下游任务。其中一类模型,即布局到图像合成(LIS),学习根据空间布局(边界框、掩码、姿态等)生成图像,已展现出生成逼真图像的潜力,尽管布局遵循性有限。此外,如何有效地将这些模型用于少样本检测数据的可扩展数据增强仍是一个未解之谜。因此,我们提出一种协作框架,运用大语言模型(LLM)和 LIS 模型来超越当前生成式数据增强方法的少样本检测。我们利用 LLM 的推理能力,通过仅凭少数几个示例注释来生成新的边界框,从而对注释空间的空间先验进行外推。此外,我们引入了我们新颖的布局感知 CLIP 分数,用于样本排序,实现生成布局与图像之间的紧密耦合。在 COCO 少样本基准测试中,我们观察到显著的性能提升。通过我们的方法,YOLOX-S 基线在 COCO 5、10 和 30 -shot 设置下的 mAP 分别提升了超过 140%、50% 和 35%。

关键词

引用

@article{arxiv.2410.06841,
  title  = {Boosting Few-Shot Detection with Large Language Models and Layout-to-Image Synthesis},
  author = {Ahmed Abdullah and Nikolas Ebert and Oliver Wasenmüller},
  journal= {arXiv preprint arXiv:2410.06841},
  year   = {2024}
}

备注

This paper has been accepted at the Asian Conference on Computer Vision (ACCV), 2024