无忘记地预测未来对象组合
计算机视觉与模式识别
2024-09-04 v2
摘要
尽管计算机视觉模型取得了显著进展,但其在面对新型对象-属性组合时的泛化能力仍有限。现有方法针对对象检测的组合零样学习(CZSL)主要聚焦于图像分类。本文旨在增强对象检测中的 CZSL,同时不忘记先前学习的知识。我们采用 Grounding DINO 并将组合软提示(CSP)纳入其中,进而扩展为组合预期技术。在 CLEVR 数据集上,我们实现了相对于 CSP 在已见与未见组合的调和平均数(HM)上达 70.5% 的提升。此外,我们引入对抗式提示调优,以逐步解决模型在相似组合之间的混淆问题。我们展示了该方法的有效性,并在预训练、增量和未见集合上实现了 HM 提升 14.5%。总体而言,这些方法为在有限数据下学习各种组合,以及在获取更多数据后提高表现不足的组合提供了框架。
引用
@article{arxiv.2407.10723,
title = {Anticipating Future Object Compositions without Forgetting},
author = {Youssef Zahran and Gertjan Burghouts and Yke Bauke Eisma},
journal= {arXiv preprint arXiv:2407.10723},
year = {2024}
}