中文

用于高时间分辨率动作识别的序列到序列建模

计算机视觉与模式识别 2021-11-05 v1 定量方法

摘要

从视频和运动学数据中自动识别动作是一个重要的机器学习问题,应用范围从机器人技术到智能健康。现有的大多数工作集中在识别粗粒度动作,如跑步、攀爬或切蔬菜,这些动作持续时间相对较长。对于需要以高时间分辨率识别细微运动的应用而言,这是一个重要的局限。例如,在中风康复中,量化康复剂量需要区分持续时间不到一秒的运动。我们的目标是弥合这一差距。为此,我们引入了一个大规模、多模态数据集StrokeRehab,作为一个新的动作识别基准,该数据集包含在高时间分辨率下标记的细微短时动作。这些短时动作被称为功能基元,包括伸手、运送、重新定位、稳定和空闲。该数据集由高质量的惯性测量单元传感器和视频数据组成,记录了41名中风受损患者进行进食、刷牙等日常生活活动的数据。我们表明,当前基于分割的最先进模型在应用于这些数据时会产生噪声预测,这通常会导致动作的重复计数。为了解决这个问题,我们提出了一种用于高分辨率动作识别的新方法,受语音识别技术启发,该方法基于直接预测动作序列的序列到序列模型。该方法在StrokeRehab数据集以及标准基准数据集50Salads、Breakfast和Jigsaws上均优于当前最先进的方法。

关键词

引用

@article{arxiv.2111.02521,
  title  = {Sequence-to-Sequence Modeling for Action Identification at High Temporal Resolution},
  author = {Aakash Kaku and Kangning Liu and Avinash Parnandi and Haresh Rengaraj Rajamohan and Kannan Venkataramanan and Anita Venkatesan and Audre Wirtanen and Natasha Pandit and Heidi Schambra and Carlos Fernandez-Granda},
  journal= {arXiv preprint arXiv:2111.02521},
  year   = {2021}
}

备注

Under review as a conference paper at ICLR 2022