中文

MMG-Ego4D:第一人称动作识别中的多模态泛化

计算机视觉与模式识别 2023-05-15 v1 人工智能

摘要

本文研究第一人称动作识别中的一个新问题,我们称之为“多模态泛化”(MMG)。MMG 旨在研究当某些模态数据有限甚至完全缺失时,系统如何泛化。我们在标准监督动作识别及更具挑战性的少样本学习新动作类别设定下对 MMG 进行了深入探讨。MMG 包含两种新场景,旨在支持实际应用中的安全性与效率考量:(1)缺失模态泛化,即训练时存在的某些模态在推理时缺失;(2)跨模态零样本泛化,即推理时与训练时出现的模态互不相交。为支持该探究,我们构建了新数据集 MMG-Ego4D,包含视频、音频与惯性运动传感器(IMU)模态的数据点。我们的数据集源自 Ego4D 数据集,但经人工专家处理并彻底重新标注,以促进 MMG 问题研究。我们在 MMG-Ego4D 上评估了多种模型,并提出了具有更强泛化能力的新方法。特别地,我们引入了带模态丢弃训练的新融合模块、基于对比的对齐训练,以及一种用于提升少样本性能的新跨模态原型损失。我们希望本研究可作为基准并指导未来多模态泛化问题的研究。基准与代码将发布于 https://github.com/facebookresearch/MMG_Ego4D。

关键词

引用

@article{arxiv.2305.07214,
  title  = {MMG-Ego4D: Multi-Modal Generalization in Egocentric Action Recognition},
  author = {Xinyu Gong and Sreyas Mohan and Naina Dhingra and Jean-Charles Bazin and Yilei Li and Zhangyang Wang and Rakesh Ranjan},
  journal= {arXiv preprint arXiv:2305.07214},
  year   = {2023}
}

备注

Accepted to CVPR 2023