中文

一种用于 Ego4D 自然语言查询挑战赛的简易基于 Transformer 的模型

计算机视觉与模式识别 2022-11-17 v1

摘要

本报告介绍了 Badgers@UW-Madison,我们向 Ego4D 自然语言查询(NLQ)挑战赛提交的方案。我们的方案继承了先前在时间动作定位工作中基于点的事件表示,并开发了基于 Transformer 的视频定位模型。此外,我们的方案集成了若干强大的视频特征,包括 SlowFast、Omnivore 和 EgoVLP。无需额外技巧,我们基于单一模型的提交取得了 12.64% 的平均 R@1,在公开排行榜上排名第 2。同时,我们的方法在 tIoU=0.3(0.5)下获得了 28.45%(18.03%)的 R@5,超越排名第一的方案多达 5.5 个绝对百分点。

关键词

引用

@article{arxiv.2211.08704,
  title  = {A Simple Transformer-Based Model for Ego4D Natural Language Queries Challenge},
  author = {Sicheng Mo and Fangzhou Mu and Yin Li},
  journal= {arXiv preprint arXiv:2211.08704},
  year   = {2022}
}

备注

5 pages, 2 figures