中文

重新思考基于两阶段框架的接地情境识别

计算机视觉与模式识别 2021-12-13 v1

摘要

接地情境识别(Grounded Situation Recognition, GSR),即识别图像中显著的活动(或动词)类别(例如购买)并检测所有相应的语义角色(例如施事者与商品),是迈向“类人”事件理解的关键一步。由于每个动词都与一组特定的语义角色相关联,所有现有的 GSR 方法都采用两阶段框架:第一阶段预测动词,第二阶段检测语义角色。然而,两个阶段都存在明显缺陷:1)用于物体识别的广泛使用的交叉熵(XE)损失在动词分类中是不够的,因为日常活动具有较大的类内差异和较高的类间相似性。2)所有语义角色都以自回归方式检测,未能建模不同角色之间复杂的语义关系。为此,我们提出了一种用于 GSR 的新型 SituFormer,其由粗到细动词模型(CFVM)和基于 Transformer 的名词模型(TNM)组成。CFVM 是一个两步动词预测模型:先用 XE 损失训练的粗粒度模型提出一组动词候选,再由用三元组损失训练的细粒度模型以增强的动词特征(不仅可分离而且有判别性)对这些候选重新排序。TNM 是一个基于 transformer 的语义角色检测模型,可并行检测所有角色。得益于 transformer 解码器的全局关系建模能力与灵活性,TNM 能充分挖掘角色间的统计依赖关系。在具有挑战性的 SWiG 基准上的大量验证表明,SituFormer 取得了新的最先进性能,并在各项指标下获得显著提升。代码见 https://github.com/kellyiss/SituFormer。

关键词

引用

@article{arxiv.2112.05375,
  title  = {Rethinking the Two-Stage Framework for Grounded Situation Recognition},
  author = {Meng Wei and Long Chen and Wei Ji and Xiaoyu Yue and Tat-Seng Chua},
  journal= {arXiv preprint arXiv:2112.05375},
  year   = {2021}
}

备注

Accepted by AAAI 2022