M&M Mix:一种多模态多视角Transformer集成方法
计算机视觉与模式识别
2022-06-22 v1
摘要
本报告描述了我们在2022年Epic-Kitchens动作识别挑战赛中获胜方案背后的方法。我们的方法建立在近期工作——用于视频识别的多视角Transformer(MTV)之上,并将其适配于多模态输入。我们的最终提交由一个多模态MTV(M&M)模型集成组成,这些模型具有不同的骨干网络规模和输入模态。我们的方法在测试集的动作类别上达到了52.8%的Top-1准确率,比去年的获胜作品高出4.1%。
引用
@article{arxiv.2206.09852,
title = {M&M Mix: A Multimodal Multiview Transformer Ensemble},
author = {Xuehan Xiong and Anurag Arnab and Arsha Nagrani and Cordelia Schmid},
journal= {arXiv preprint arXiv:2206.09852},
year = {2022}
}
备注
Technical report for Epic-Kitchens challenge 2022