中文

通过视觉语言模型中的知识增强提升神经退行性疾病的步态视频分析

计算机视觉与模式识别 2024-10-16 v2

摘要

我们提出了一种知识增强策略,用于从单目步态视频中评估诊断分组和步态损伤。基于大规模预训练的视觉语言模型(VLM),我们的模型通过跨三种不同模态(步态视频、特定类别描述和数值步态参数)的集体学习,来学习和改进患者步态视频的视觉、文本和数值表示。我们的具体贡献有两方面:首先,我们采用知识感知的提示微调策略,利用特定类别的医学描述来指导文本提示学习。其次,我们以数值文本的形式整合配对的步态参数,以增强文本表示的数值能力。结果表明,我们的模型不仅在基于视频的分类任务中显著优于最先进的方法,而且能熟练地将学习到的特定类别文本特征解码为使用定量步态参数量表描述的自然语言。代码和模型将在我们的项目页面上提供:https://lisqzqng.github.io/GaitAnalysisVLM/。

关键词

引用

@article{arxiv.2403.13756,
  title  = {Enhancing Gait Video Analysis in Neurodegenerative Diseases by Knowledge Augmentation in Vision Language Model},
  author = {Diwei Wang and Kun Yuan and Candice Muller and Frédéric Blanc and Nicolas Padoy and Hyewon Seo},
  journal= {arXiv preprint arXiv:2403.13756},
  year   = {2024}
}

备注

MICCAI 2024