基于视频级标签的帧级实时评估偏颇运动:任务特定模型与基础模型比较
图像与视频处理
2025-06-05 v1
摘要
中风康复需求日益增长,亟需支持自主运动的解决方案。虚拟教练可从视频数据中提供实时运动反馈,帮助患者改善运动功能并维持参与度。然而,训练实时运动分析系统需要帧级标注,标注工作量大且成本高昂。本文提出一种框架,通过学习从视频级标注中对 individual frames 进行分类,以实现康复训练中补偿性动作的实时评估。我们采用梯度方法和伪标签选择技术,创建用于训练帧级分类器的帧级伪标签。我们利用预训练的任务特定模型——Action Transformer、SkateFormer——以及基础模型——MOMENT——生成伪标签,以提升对新患者的泛化能力。为验证该方法,我们使用包含18名中风患者完成五种康复训练项目的 SERE 数据集,数据标注了补偿性动作。MOMENT 在视频级评估中取得更佳结果(AUC = 73%),超越基线 LSTM(AUC = 58%)。采用集成梯度技术,Action Transformer 在帧级评估中表现更佳(AUC = 72%),显著优于使用真实帧级标注训练的基线模型(AUC = 69%)。我们展示,结合预训练模型的所提出方法能增强模型的泛化能力,促进对新患者的定制化,降低数据标注的需求。
引用
@article{arxiv.2506.03752,
title = {Frame-Level Real-Time Assessment of Stroke Rehabilitation Exercises from Video-Level Labeled Data: Task-Specific vs. Foundation Models},
author = {Gonçalo Mesquita and Ana Rita Cóias and Artur Dubrawski and Alexandre Bernardino},
journal= {arXiv preprint arXiv:2506.03752},
year = {2025}
}