MMTA:面向精细康复评估的多成员时序注意力机制
计算机视觉与模式识别
2026-03-03 v1
摘要
为 empowerment 康复过程中持续评估,需要对日常活动中的能力进行自动化评估,要求对治疗视频中的细粒度动作进行时序精准分割。现有的时序动作分割(TAS)模型在保持运动情境的同时难以捕捉亚秒级微运动,导致快速阶段转换模糊化,限制了对运动恢复的可靠下游评估。我们提出一种名为多成员时序注意力(MMTA)的高分辨率时序变换器,用于细粒度康复评估。与标准时序注意力不同,后者在每一层为每个帧分配单个注意力上下文,而 MMTA 允许每个帧在同一层内attend 多个局部归一化时序注意力窗口。我们通过特征空间重叠解决方法融合这些并发时序视图,既保留过渡附近竞争性局部上下文,又通过层级传播实现更长范围的推理。这样在无需额外深度或多阶段细化的情况下提高了边界灵敏度。MMTA 支持视频和可穿戴 IMU 输入,统一的单阶段架构使其适用于临床和居家环境。MMTA 在 StrokeRehab 数据集上相较于全局注意力变换器 consistently 提升 Edit Score,视频提升 +1.3,IMU 提升 +1.6;在 50Salads 数据集上进一步提升 +3.3。消融实验确认,性能提升源于多成员时序视图而非模型架构复杂度,为资源受限的康复评估提供了实用解决方案。
引用
@article{arxiv.2603.00878,
title = {MMTA: Multi Membership Temporal Attention for Fine-Grained Stroke Rehabilitation Assessment},
author = {Halil Ismail Helvaci and Justin Huber and Jihye Bae and Sen-ching Samson Cheung},
journal= {arXiv preprint arXiv:2603.00878},
year = {2026}
}