中文

通过语言解释器看穿类别:零样本 grounding 情境识别

计算机视觉与模式识别 2024-04-25 v1

摘要

受预训练视觉语言模型(VLM)强大泛化能力的益处,CLIP 等模型广泛用于零样本场景理解。与简单识别任务不同,grounded situation recognition(GSR)要求模型不仅要对图像中显著活动(动词)进行分类,还要检测参与该动作的所有语义角色。这个复杂任务通常涉及三个步骤:动词识别、语义角色定位和名词识别。直接使用基于类的提示词为 VLMs 和 grounding 模型完成此任务存在诸多局限性,例如难以区分模糊的动词概念、难以准确定位带固定动词中心模板输入的角色,以及难以实现情境感知的名词预测。本文认为,这些局限性源于模型对动词/名词类的理解不足。为此,我们引入一种通过 Language EXplainer(LEX)实现的零样本 GSR 方法,通过三个解释器显著提升模型的综合能力:1)动词解释器生成通用动词中心描述以增强不同动词类的辨识度;2)grounding 解释器重新表述动词中心模板以促进更清晰的理解,从而提升精确的语义角色定位;3)名词解释器创建场景特定的名词描述以确保情境感知的名词识别。通过为 GSR 流程的每个步骤配备一个辅助解释器,LEX 促进了现实场景中复杂的场景理解。我们在 SWiG 数据集上进行了广泛的验证,证明了 LEX 在零样本 GSR 中的有效性和可互操作性。

关键词

引用

@article{arxiv.2404.15785,
  title  = {Seeing Beyond Classes: Zero-Shot Grounded Situation Recognition via Language Explainer},
  author = {Jiaming Lei and Lin Li and Chunping Wang and Jun Xiao and Long Chen},
  journal= {arXiv preprint arXiv:2404.15785},
  year   = {2024}
}