中文

探索多模态自我中心数据集中的缺失模态

计算机视觉与模式识别 2024-04-18 v2

摘要

多模态视频理解对于分析自我中心视频至关重要,其中整合多种感官信号可显著增强动作识别和时刻定位。然而,由于隐私问题、效率需求或硬件故障等因素,实际应用中经常面临模态不完整的情况。针对这一问题,我们的研究深入探讨了缺失模态对自我中心动作识别的影响,特别是在基于 Transformer 的模型中。我们引入了一个新概念——缺失模态标记,即使在模态缺失时也能保持性能,这一策略在 Ego4D、Epic-Kitchens 和 Epic-Sounds 数据集中证明是有效的。我们的方法减轻了性能损失,当一半的测试集存在模态不完整时,将其从最初的约 30% 下降降至仅约 10%。通过广泛的实验,我们证明了 MMT 对不同训练场景的适应性,以及在处理缺失模态方面与现有方法相比的优越性。我们的研究提供了全面的分析和创新的方法,为现实环境中更具弹性的多模态系统开辟了道路。

关键词

引用

@article{arxiv.2401.11470,
  title  = {Exploring Missing Modality in Multimodal Egocentric Datasets},
  author = {Merey Ramazanova and Alejandro Pardo and Humam Alwassel and Bernard Ghanem},
  journal= {arXiv preprint arXiv:2401.11470},
  year   = {2024}
}