中文

基准化视频基础模型用于远程帕金森病筛查

计算机视觉与模式识别 2026-02-27 v2

摘要

基于视频的评估为远程帕金森病(PD)筛查提供了可扩展的途径。虽然传统方法依赖于仿临床量表的人工提取特征,但近期视频基础模型(VFM)的进展使能够无需任务特定定制地进行表征学习。然而,不同VFM架构在多样临床任务上的比较效果仍鲜为人知。我们present了一项大规模系统性研究,使用来自1888名参与者(其中727名确诊PD)、覆盖16个标准化临床任务、共32,847个视频的新型视频数据集。我们评估了七种最新视频基础模型(包括VideoPrism、V-JEPA、ViViT和VideoMAE),以确定其在临床筛查中的鲁棒性。通过对冻结嵌入使用线性分类头进行评估,我们展示,任务显著性高度依赖于模型:VideoPrism在捕捉视觉语言学(无音频)和面部表达方面表现突出,而V-JEPA在上肢运动任务中优异。值得注意的是,TimeSformer在指尖敲击等节奏任务中仍然高度具竞争力。我们的实验得出的AUC为76.4%-85.3%,准确率为71.5%-80.6%。虽然高特异性(最高达90.3%)表明其在排除健康个体方面具有强大潜力,但较低的灵敏度(43.2%-57.3%)凸显了任务感知校准和整合多任务与多模态的必要性。总体而言,本工作为VFM基于PD筛查建立了严谨的基准,并为远程神经病学监测中选择合适任务与架构提供了路线图。代码和匿名结构化数据已公开:https://anonymous.4open.science/r/parkinson_video_benchmarking-A2C5

关键词

引用

@article{arxiv.2602.13507,
  title  = {Benchmarking Video Foundation Models for Remote Parkinson's Disease Screening},
  author = {Md Saiful Islam and Ekram Hossain and Abdelrahman Abdelkader and Tariq Adnan and Fazla Rabbi Mashrur and Sooyong Park and Praveen Kumar and Qasim Sudais and Natalia Chunga and Nami Shah and Jan Freyberg and Christopher Kanan and Ruth Schneider and Ehsan Hoque},
  journal= {arXiv preprint arXiv:2602.13507},
  year   = {2026}
}