中文

MMeViT: 多模态集成 ViT 用于卒中后康复动作识别

计算机视觉与模式识别 2025-09-30 v1 人工智能

摘要

卒中患者的康复治疗面临供给不足的问题,尽管需求日益增长。为解决这一问题,减轻医护人员负担的远程监测系统正作为一种可行的替代方案出现。这类远程监测系统的关键组成部分是人体动作识别(HAR)技术,用于对动作进行分类。然而,现有的 HAR 研究主要针对非残疾人群,使其不适合识别卒中患者的行为。针对卒中的 HAR 研究大多集中于使用机器学习而非深度学习对相对简单的动作进行分类。在本研究中,我们设计了一个用于监测卒中患者动作的系统,重点关注居家上肢日常生活活动(ADL)。我们的系统利用了 IMU(惯性测量单元)传感器和 RGB-D 相机,这是 HAR 中最常见的模态。我们通过该系统直接收集了一个数据集,探讨了适当的预处理方法,并提出了一种适合处理多模态数据的深度学习模型。我们对所收集的数据集进行分析后发现,卒中患者的动作数据比非残疾人群的动作数据聚类性更弱。同时,我们发现所提出的模型在难以聚类的特征数据上,对每个标签学习到了相似的趋势。本研究表明,将学习过卒中患者动作特征的深度学习模型扩展至不仅限于简单动作识别,还包括有助于居家康复的评估等反馈功能,在未来研究中具有可能性。本研究中提供的代码可在 https://github.com/ye-Kim/MMeViT 获取。

关键词

引用

@article{arxiv.2509.23044,
  title  = {MMeViT: Multi-Modal ensemble ViT for Post-Stroke Rehabilitation Action Recognition},
  author = {Ye-eun Kim and Suhyeon Lim and Andrew J. Choi},
  journal= {arXiv preprint arXiv:2509.23044},
  year   = {2025}
}

备注

9 pages, 9 figures