中文

基于多模态深度学习的日常活动识别:面向Ambient Assisted Living 的视频、姿态与物体感知方法

计算机视觉与模式识别 2026-03-06 v1

摘要

日常活动识别是有效的Ambient Assisted Living(AAL)系统的关键要素,尤其用于监测老年人健康状况并支持其在室内环境中的独立生活。然而,开发稳健的活动识别系统面临诸多挑战,包括类内变异性、类间相似性、环境变异性、摄像机视角以及场景复杂性。本文提出一种针对AAL场景中老年人的多模态方法,用于日常活动的识别。该方法将由3D卷积神经网络(CNN)处理的视觉信息,与由图卷积网络分析的3D人体姿态数据相集成。从物体检测模块派生的上下文信息通过cross-attention机制与3D CNN特征融合,以提高识别准确率。该方法采用Toyota SmartHome数据集进行评估,该数据集包含真实世界中的室内活动。结果表明,所提出的方法在多种日常活动上实现了具备竞争力的分类准确率,凸显其作为先进AAL监控解决方案关键组件的潜力。该进展支持开发旨在促进老年人安全与自主性的智能系统的更广泛目标。

关键词

引用

@article{arxiv.2603.04509,
  title  = {Recognition of Daily Activities through Multi-Modal Deep Learning: A Video, Pose, and Object-Aware Approach for Ambient Assisted Living},
  author = {Kooshan Hashemifard and Pau Climent-Pérez and Francisco Florez-Revuelta},
  journal= {arXiv preprint arXiv:2603.04509},
  year   = {2026}
}