中文

GSRFormer:具有交替语义注意力精炼的接地情境识别 Transformer

计算机视觉与模式识别 2022-11-29 v4 人工智能 计算与语言 多媒体

摘要

接地情境识别(GSR)旨在为图像生成结构化语义摘要以实现“类人”事件理解。具体地,GSR 任务不仅检测显著活动动词(如 buying),还预测所有相应语义角色(如 agent 和 goods)。受目标检测与图像字幕任务启发,现有方法通常采用两阶段框架:1)检测活动动词,然后 2)基于检测到的动词预测语义角色。显然,此不合逻辑框架构成语义理解的巨大障碍。首先,仅在没有语义角色情况下预检测动词不可避免地无法区分许多相似日常活动(如 offering 与 giving、buying 与 selling)。其次,以封闭自回归方式预测语义角色难以利用动词与角色间的语义关系。为此,本文提出一种新颖两阶段框架,专注于利用动词与角色间的此类双向关系。在第一阶段,我们不预检测动词,而是推迟检测步骤并假设伪标签,从中从图像学习各对应语义角色的中间表示。在第二阶段,我们利用 transformer 层挖掘动词与语义角色内的潜在语义关系。借助一组支持图像,设计交替学习方案同时优化结果:用图像对应名词更新动词,并用支持图像动词更新名词。在具挑战性的 SWiG 基准上的大量实验结果表明,我们的革新框架在各种指标下优于其他最先进方法。

关键词

引用

@article{arxiv.2208.08965,
  title  = {GSRFormer: Grounded Situation Recognition Transformer with Alternate Semantic Attention Refinement},
  author = {Zhi-Qi Cheng and Qi Dai and Siyao Li and Teruko Mitamura and Alexander G. Hauptmann},
  journal= {arXiv preprint arXiv:2208.08965},
  year   = {2022}
}

备注

ACM Multimedia 2022 (Oral), Code: https://github.com/zhiqic/GSRFormer