照亮阴影:基于概念引导的长尾实体 grounding 增强
计算机视觉与模式识别
2024-06-18 v1 计算与语言
摘要
多模态知识图谱(MMKGs)已证明对各种下游任务具有重要价值。然而,规模化构建它们面临挑战,因为这往往会引入不匹配的图像(即噪声)。知识图谱中的大多数实体属于长尾,意味着在线上可获取的此类实体图像有限。这一稀缺性使得确定找到的图像是否匹配该实体变得困难。为此,我们借鉴三角参考理论,建议通过概念引导来增强视觉语言模型。具体而言,我们引入 COG,这是一个具有概念引导视觉语言模型的两阶段框架。该框架包括概念集成模块,用于有效识别长尾实体的图像-文本对,以及证据融合模块,后者提供可解释性并使人类验证成为可能。为演示 COG 的有效性,我们创建了一个包含 25000 条长尾实体图像-文本对的数据集。我们的全面实验表明,COG 不仅在准确识别长尾图像-文本对方面优于基线方法,而且在灵活性和可解释性方面也表现出色。
引用
@article{arxiv.2406.10902,
title = {Light Up the Shadows: Enhance Long-Tailed Entity Grounding with Concept-Guided Vision-Language Models},
author = {Yikai Zhang and Qianyu He and Xintao Wang and Siyu Yuan and Jiaqing Liang and Yanghua Xiao},
journal= {arXiv preprint arXiv:2406.10902},
year = {2024}
}