多模态大语言模型能否理解病理运动?关于癫痫半导象的探索性研究
计算机视觉与模式识别
2026-05-06 v1 人工智能
摘要
多模态大语言模型(MLLMs)已在识别日常人类活动方面展现出强大的能力,但其在分析神经疾病中临床意义的非自主运动方面的潜力仍鲜有探索。本探索性研究评估了 MLLMs 在癫痫视频中识别病理运动的能力。我们在 90 例临床癫痫录像中,对 20 项由 ILAE 定义的半导象特征,对比了最先进的 MLLMs 的零样本性能与微调的卷积神经网络(CNN)和视觉转换器(ViT)基线模型的性能。MLLMs 在 13 项特征上超越了基线模型,无需任务特定训练,展现出在识别显著的后 posture 和情境特征方面的优势,但在识别细微的、高频率的运动方面存在困难。特征目标信号增强(面部裁剪、姿态估计、音频降噪)在 10 项特征上提升了性能。专家评估显示,94.3% 的 MLLM 生成的正确预测案例的解释达到了至少 60% 的忠诚度分数,与癫痫病理医生的推理一致。这些发现表明,通过针对性预处理策略,可以将通用 MLLMs 应用于专业临床视频分析,为可解释、高效的诊断辅助提供了一条路径。我们的代码已公开于 https://github.com/LinaZhangUCLA/PathMotionMLLM。
引用
@article{arxiv.2605.03352,
title = {Can Multimodal Large Language Models Understand Pathologic Movements? A Pilot Study on Seizure Semiology},
author = {Lina Zhang and Tonmoy Monsoor and Mehmet Efe Lorasdagi and Prateik Sinha and Chong Han and Peizheng Li and Yuan Wang and Jessica Pasqua and Colin McCrimmon and Rajarshi Mazumder and Vwani Roychowdhury},
journal= {arXiv preprint arXiv:2605.03352},
year = {2026}
}