视觉问答中的多源组合泛化
计算机视觉与模式识别
2025-05-30 v1 人工智能
摘要
组合泛化是指从已见基元泛化到新组合的能力,近期在视觉与语言 (V&L) 领域受到了广泛关注。由于 V&L 任务的多模态特性,构成组合的基元来源于不同模态,从而产生了多源新组合。然而,对多源新组合的泛化能力,即多源组合泛化 (MSCG),仍有待探索。本文在视觉问答 (VQA) 的背景下探索 MSCG,并提出了一种检索增强的训练框架,通过学习不同模态基元的统一表示来增强 VQA 模型的 MSCG 能力。具体而言,为训练样本中的每个基元检索语义等价的基元,并将检索到的特征与原始基元聚合以优化模型。这一过程帮助模型学习同一语义基元在不同模态间的一致表示。为了评估 VQA 模型的 MSCG 能力,我们基于 GQA 数据集构建了一个新的 GQA-MSCG 数据集,其中的样本包含由不同模态基元组成的三种新组合。实验结果证明了所提框架的有效性。我们在 https://github.com/NeverMoreLCH/MSCG 发布了 GQA-MSCG。
引用
@article{arxiv.2505.23045,
title = {Multi-Sourced Compositional Generalization in Visual Question Answering},
author = {Chuanhao Li and Wenbo Ye and Zhen Li and Yuwei Wu and Yunde Jia},
journal= {arXiv preprint arXiv:2505.23045},
year = {2025}
}
备注
Accepted by IJCAI 2025