中文

基于多模态RGB-D融合和大语言模型的帕金棃病步态识别可解释方法

计算机视觉与模式识别 2025-12-05 v1 人工智能

摘要

准确且可解释的步态分析在早期检测帕金棃病(PD)中发挥着关键作用,但大多数现有方法受限于单模态输入、低鲁棒性以及缺乏临床透明度。本文提出了一种可解释的多模态框架,将RGB和深度(RGB-D)数据融合,用于在真实条件下识别帕金棃病步态模式。该系统采用双YOLOv11-based编码器进行模态特定特征提取,随后通过多尺度局部-全局提取(MLGE)模块和跨空间颈部融合机制增强时空表征。该设计能够捕捉细粒度肢体运动(例如肘部摆幅减小)和整体步态动力学(例如步幅缩短或转向困难),即使在光照不足或因服装遮挡等具挑战性情境下也能准确工作。为确保可解释性,本文引入一个冻结的大语言模型(LLM),将融合后的视觉嵌入和结构化元数据转化为临床上有意义的文本解释。实验评估表明,所提出的RGB-D融合框架在多模态步态数据集上实现了更高的识别准确率,提高了对环境变化的鲁棒性,并实现了清晰的视觉-语言推理。通过将多模态特征学习与语言可解释性相结合,本研究搭建了视觉识别与临床理解之间的鸿沟,为可靠且可解释的帕金棃病步态分析提供了新的视觉-语言范式。代码:https://github.com/manaralnaasan/RGB-D_parkinson-LLM

关键词

引用

@article{arxiv.2512.04425,
  title  = {Explainable Parkinsons Disease Gait Recognition Using Multimodal RGB-D Fusion and Large Language Models},
  author = {Manar Alnaasan and Md Selim Sarowar and Sungho Kim},
  journal= {arXiv preprint arXiv:2512.04425},
  year   = {2025}
}