使用CTC损失与扩展前缀束搜索的单阶段进食动作检测
计算机视觉与模式识别
2020-11-24 v2 人机交互
机器学习
摘要
准确检测个体进食动作是实现自动饮食监测的关键步骤。腕部运动的惯性传感器数据以及描绘上半身的视频数据都已被用于此目的。迄今为止最先进的方法采用两阶段方法,即(i)使用深度神经网络从传感器数据学习帧级进食概率,然后(ii)通过寻找帧级概率的最大值来检测稀疏的进食事件。在本研究中,我们提出一种单阶段方法,直接将传感器数据学习得到的概率解码为稀疏的进食检测。这是通过采用Connectionist Temporal Classification (CTC)损失的弱监督训练,以及使用一种新颖的扩展前缀束搜索解码算法来实现的。该方法的好处包括(i)用于检测的端到端训练,(ii)简化的进食动作标注时间要求,以及(iii)相较于现有方法提升的检测性能。在两个独立数据集上,对于进食检测和饮食/饮水检测任务,无论是视频还是惯性传感器,我们相较两阶段方法取得了介于1.9%至6.2%之间的相对分数提升。
引用
@article{arxiv.2008.02999,
title = {Single-stage intake gesture detection using CTC loss and extended prefix beam search},
author = {Philipp V. Rouast and Marc T. P. Adam},
journal= {arXiv preprint arXiv:2008.02999},
year = {2020}
}