中文

用于多模态动作预期的前摄特征融合 Transformer

计算机视觉与模式识别 2022-10-25 v1 机器人学

摘要

尽管人类动作预期本质上是一项多模态任务,但在知名动作预期数据集上的最优方法往往通过集成方法并利用该数据,对单模态预期网络的分数进行平均。本工作中我们引入基于 Transformer 的模态融合技术,在早期阶段统一多模态数据。我们的前摄特征融合 Transformer(AFFT)被证明优于流行的分数融合方法,并在 EpicKitchens-100 与 EGTEA Gaze+ 上取得了超越以往方法的最优结果。我们的模型易于扩展,可在不改变架构的情况下加入新模态。因此,我们在 EpicKitchens-100 上提取了音频特征,并将其加入社区常用特征集合中。

关键词

引用

@article{arxiv.2210.12649,
  title  = {Anticipative Feature Fusion Transformer for Multi-Modal Action Anticipation},
  author = {Zeyun Zhong and David Schneider and Michael Voit and Rainer Stiefelhagen and Jürgen Beyerer},
  journal= {arXiv preprint arXiv:2210.12649},
  year   = {2022}
}

备注

Accepted to WACV 2023