中文

VS-TransGRU:一种基于Transformer-GRU并经由视觉—语义融合增强的第一人称动作预期框架

计算机视觉与模式识别 2023-07-11 v1

摘要

第一人称动作预期是一项具有挑战性的任务,旨在基于当前与历史观测从第一视角对未来动作进行提前预测。大多数现有方法侧重于基于视觉输入和循环神经网络改进模型架构与损失函数以提升预期性能。然而,这些仅考虑视觉信息且依赖单一网络架构的方法逐渐达到性能瓶颈。为了充分理解已观测内容并足够好地捕捉当前观测与未来动作之间的依赖关系,我们在本文中提出一种新颖的视觉—语义融合增强且基于Transformer-GRU的动作预期框架。首先,我们首次引入高层语义信息以提升动作预期性能。我们提出使用基于类标签生成或直接从视觉观测生成的语义特征来增强原始视觉特征。其次,提出一种有效的视觉—语义融合模块,以弥补语义鸿沟并充分利用不同模态的互补性。第三,为兼顾并行与自回归模型优势,我们设计了一个基于Transformer的编码器用于长期序列建模,以及一个基于GRU的解码器用于灵活迭代解码。在两个大规模第一视角数据集(即EPIC-Kitchens与EGTEA Gaze+)上的大量实验验证了我们所提方法的有效性,其取得了新的最先进性能,大幅优于以往方法。

关键词

引用

@article{arxiv.2307.03918,
  title  = {VS-TransGRU: A Novel Transformer-GRU-based Framework Enhanced by Visual-Semantic Fusion for Egocentric Action Anticipation},
  author = {Congqi Cao and Ze Sun and Qinyi Lv and Lingtong Min and Yanning Zhang},
  journal= {arXiv preprint arXiv:2307.03918},
  year   = {2023}
}

备注

12 pages, 7 figures