中文

面向持续第一人称活动识别:一个用于持续学习的多模态第一人称活动数据集

计算机视觉与模式识别 2024-10-18 v1

摘要

随着可穿戴摄像头的快速发展,大量用于第一人称视觉感知的第一人称视频得以采集。利用第一人称视频预测第一人称活动面临诸多挑战,包括有限的视野、遮挡以及不稳定的运动。观察到可穿戴设备的传感器数据有助于人类活动识别,多模态活动识别正受到越来越多的关注。然而,相关数据集的匮乏阻碍了面向第一人称活动识别的多模态深度学习的发展。如今,现实世界中的深度学习已促使研究聚焦于常受灾难性遗忘困扰的持续学习。但第一人称活动识别中的灾难性遗忘问题,尤其在多模态背景下,因缺乏数据集而仍未得到探索。为辅助该研究,我们提出一个用于持续学习的多模态第一人称活动数据集 UESTC-MMEA-CL,其由集成第一人称摄像头与可穿戴传感器的自研眼镜采集。它包含 10 名参与者执行的 32 类日常活动的视频、加速度计与陀螺仪的同步数据。将其类别类型与规模同其他公开数据集进行比较。给出传感器数据的统计分析以展示对不同行为的辅助效果。并报告在基础网络架构上单独及联合使用 RGB、加速度与陀螺仪三种模态时的第一人称活动识别结果。为探索持续学习任务中的灾难性遗忘,使用不同多模态组合对四种基线方法进行了广泛评估。我们希望 UESTC-MMEA-CL 能推动未来在可穿戴应用中面向第一人称活动识别的持续学习研究。

关键词

引用

@article{arxiv.2301.10931,
  title  = {Towards Continual Egocentric Activity Recognition: A Multi-modal Egocentric Activity Dataset for Continual Learning},
  author = {Linfeng Xu and Qingbo Wu and Lili Pan and Fanman Meng and Hongliang Li and Chiyuan He and Hanxin Wang and Shaoxu Cheng and Yu Dai},
  journal= {arXiv preprint arXiv:2301.10931},
  year   = {2024}
}

备注

IEEE Transactions on Multimedia