中文

面向基础情境识别的协作式Transformer

计算机视觉与模式识别 2022-03-31 v1 人工智能 机器学习

摘要

基础情境识别旨在预测主要活动、在活动中扮演特定角色的实体,以及给定图像中实体的边界框定位。为有效应对这一挑战性任务,我们引入一种新方法,其中活动分类与实体估计两个过程具有交互性与互补性。为实现该思想,我们提出协作式扫视-凝视Transformer(CoFormer),其由两个模块组成:用于活动分类的扫视Transformer与用于实体估计的凝视Transformer。扫视Transformer在分析实体及其关系的凝视Transformer辅助下预测主要活动,而凝视Transformer通过仅关注由扫视Transformer预测出的活动相关的实体来估计定位实体。我们的CoFormer在SWiG数据集的所有评估指标上均达到最先进水平。训练代码与模型权重见 https://github.com/jhcho99/CoFormer。

关键词

引用

@article{arxiv.2203.16518,
  title  = {Collaborative Transformers for Grounded Situation Recognition},
  author = {Junhyeong Cho and Youngseok Yoon and Suha Kwak},
  journal= {arXiv preprint arXiv:2203.16518},
  year   = {2022}
}

备注

Accepted to CVPR 2022, Code: https://github.com/jhcho99/CoFormer