通过自集成提升视觉推理的泛化能力
计算机视觉与模式识别
2024-11-04 v2
摘要
视觉推理的认知能力需要整合多模态感知处理以及常识和关于世界的外部知识。近年来,提出了大量大型视觉语言模型 (LVLMs),展示了在跨领域和跨任务的常识推理中卓越的能力和出色的熟练度。然而,训练此类 LVLMs 需要大量昂贵的资源。最近的方法不再在各种大型数据集上从头训练 LVLMs,而是专注于探索利用许多不同 LVLMs 能力的方法,例如集成方法。在这项工作中,我们提出了自集成,这是一种无需更新任何参数即可提升模型泛化能力和视觉推理能力的新方法,即一种免训练方法。我们的关键洞察是,我们意识到 LVLM 本身无需任何其他 LVLMs 即可进行集成,这有助于解锁其内部能力。在各种基准上的大量实验证明了我们方法的有效性,在 SketchyVQA、外部知识 VQA 和分布外 VQA 任务上实现了最先进的 (SOTA) 性能。
引用
@article{arxiv.2410.20883,
title = {Improving Generalization in Visual Reasoning via Self-Ensemble},
author = {Tien-Huy Nguyen and Quang-Khai Tran and Anh-Tuan Quang-Hoang},
journal= {arXiv preprint arXiv:2410.20883},
year = {2024}
}