中文

切分与检测:利用大型基础视频理解模型在切分后的未修剪视频上进行人体跌倒检测

计算机视觉与模式识别 2024-01-30 v1

摘要

本研究探索了大型视频理解基础模型在未修剪视频的下游任务——人体跌倒检测上的性能,并利用预训练的视觉Transformer进行多类别动作检测,类别包括:“跌倒”、“躺卧”和“其他/日常生活活动(ADL)”。本文展示了一种基于对未修剪视频进行简单切分的时间动作定位方法。该方法论包含一个预处理流程,将带有时间戳动作标注的数据集转换为由短动作片段组成的标注数据集。文中引入了简单有效的片段采样策略。所提方法的有效性已在公开的高质量跌倒模拟数据集(HQFSD)上进行了实证评估。实验结果验证了所提流程的性能。这些结果对于实时应用而言前景广阔,在给定的实验设置下,跌倒检测在视频层面上的F1分数达到了最先进的0.96。源代码将在GitHub上公开。

关键词

引用

@article{arxiv.2401.16280,
  title  = {Cutup and Detect: Human Fall Detection on Cutup Untrimmed Videos Using a Large Foundational Video Understanding Model},
  author = {Till Grutschus and Ola Karrar and Emir Esenov and Ekta Vats},
  journal= {arXiv preprint arXiv:2401.16280},
  year   = {2024}
}