一种用于 Ego4D 自然语言查询挑战赛的简易基于 Transformer 的模型
计算机视觉与模式识别
2022-11-17 v1
摘要
本报告介绍了 Badgers@UW-Madison,我们向 Ego4D 自然语言查询(NLQ)挑战赛提交的方案。我们的方案继承了先前在时间动作定位工作中基于点的事件表示,并开发了基于 Transformer 的视频定位模型。此外,我们的方案集成了若干强大的视频特征,包括 SlowFast、Omnivore 和 EgoVLP。无需额外技巧,我们基于单一模型的提交取得了 12.64% 的平均 R@1,在公开排行榜上排名第 2。同时,我们的方法在 tIoU=0.3(0.5)下获得了 28.45%(18.03%)的 R@5,超越排名第一的方案多达 5.5 个绝对百分点。
引用
@article{arxiv.2211.08704,
title = {A Simple Transformer-Based Model for Ego4D Natural Language Queries Challenge},
author = {Sicheng Mo and Fangzhou Mu and Yin Li},
journal= {arXiv preprint arXiv:2211.08704},
year = {2022}
}
备注
5 pages, 2 figures