视觉语言模型在人类运动理解中的潜力与局限:基于数据驱动的中风康复案例研究
计算机视觉与模式识别
2025-11-25 v1
摘要
视觉语言模型(Vision-language Models, VLMs)在广泛的计算机视觉任务中展现出惊人的性能,引发了其在数字健康领域应用潜力的关注。本文将VLMs应用于数据驱动中风康复中的两个基本挑战:视频中康复剂量和功能损害的自动量化。我们将这些问题表述为运动识别任务,可使用VLMs解决。我们在29名健康对照组和51名中风存活者队列上评估了所提出的框架。结果表明,当前VLMs缺乏对精细运动理解的能力,无法实现精确的量化:剂量估计与排除视觉信息的基线相当,功能损害评分无法可靠预测。尽管如此,若干发现仍指向未来前景。通过优化提示策略和后处理,VLMs能够从少数帧中对高层次活动进行分类,检测运动和抓取并具有一定准确性,对于轻度受损和健康参与者的剂量计数误差可控制在25%以内,这一切都无需特定任务的训练或微调。这些结果既凸显了VLMs在数据驱动中风康复及更广泛临床视频分析中的当前局限,也揭示了潜在的机遇。
引用
@article{arxiv.2511.17727,
title = {The Potential and Limitations of Vision-Language Models for Human Motion Understanding: A Case Study in Data-Driven Stroke Rehabilitation},
author = {Victor Li and Naveenraj Kamalakannan and Avinash Parnandi and Heidi Schambra and Carlos Fernandez-Granda},
journal= {arXiv preprint arXiv:2511.17727},
year = {2025}
}