通过语义接地解决视觉语言任务中目标提议评估错位问题
计算机视觉与模式识别
2023-09-04 v1 计算与语言
摘要
目标提议生成是视觉语言(VL)任务(图像描述、视觉问答等)的标准预处理步骤。当前为 VL 任务生成的目标提议的性能是在所有可用标注上评估的,我们表明该协议存在错位——更高的分数未必对应于下游 VL 任务性能的改善。我们的工作是对此现象的一项研究,并探索语义接地缓解其影响的有效性。为此,我们提出仅针对可用标注的一个子集来评估目标提议,该子集通过标注重要性分数阈值化选取。目标标注对 VL 任务的重要性通过从描述图像的文字中提取相关语义信息来量化。我们表明,与现有技术相比,我们的方法具有一致性,并与由图像描述指标及人工标注所选标注表现出大幅改善的对齐。最后,我们比较了场景图生成(SGG)基准中使用的当前检测器作为用例,该用例展示了传统目标提议评估技术错位的情形。
引用
@article{arxiv.2309.00215,
title = {Towards Addressing the Misalignment of Object Proposal Evaluation for Vision-Language Tasks via Semantic Grounding},
author = {Joshua Feinglass and Yezhou Yang},
journal= {arXiv preprint arXiv:2309.00215},
year = {2023}
}
备注
Accepted to WACV 2024 (Round 1)