中文

无忘记地预测未来对象组合

计算机视觉与模式识别 2024-09-04 v2

摘要

尽管计算机视觉模型取得了显著进展,但其在面对新型对象-属性组合时的泛化能力仍有限。现有方法针对对象检测的组合零样学习(CZSL)主要聚焦于图像分类。本文旨在增强对象检测中的 CZSL,同时不忘记先前学习的知识。我们采用 Grounding DINO 并将组合软提示(CSP)纳入其中,进而扩展为组合预期技术。在 CLEVR 数据集上,我们实现了相对于 CSP 在已见与未见组合的调和平均数(HM)上达 70.5% 的提升。此外,我们引入对抗式提示调优,以逐步解决模型在相似组合之间的混淆问题。我们展示了该方法的有效性,并在预训练、增量和未见集合上实现了 HM 提升 14.5%。总体而言,这些方法为在有限数据下学习各种组合,以及在获取更多数据后提高表现不足的组合提供了框架。

关键词

引用

@article{arxiv.2407.10723,
  title  = {Anticipating Future Object Compositions without Forgetting},
  author = {Youssef Zahran and Gertjan Burghouts and Yke Bauke Eisma},
  journal= {arXiv preprint arXiv:2407.10723},
  year   = {2024}
}