协作学习环境中的长时目标检测与追踪
计算机视觉与模式识别
2021-06-15 v1 人工智能
机器学习
摘要
视频中的人体活动识别是一个具有挑战性的问题,尤其在需要分析大型视频数据库时备受关注。AOLME项目为中学生提供了一个协作学习环境,通过处理数字图像与视频来探索数学、计算机科学与工程。作为该项目的一部分,收集了约2200小时的视频数据用于分析。由于数据集规模庞大,人工分析所有视频十分困难。因此,亟需可靠的基于计算机的方法来检测感兴趣的活动。我的论文聚焦于开发在长视频中检测与追踪目标的精确方法。所有模型均在7个不同场次(时长45至90分钟)的视频上验证。键盘检测器在0.5交并比(IoU)下取得了92%的极高平均精度(AP)。此外,将检测器与快速追踪器KCF(159fps)结合成系统,使算法在精度不损的前提下显著提速。对于一段分辨率858×480@30fps、时长23分钟的视频,单独检测以4.7倍实时运行,而结合算法以21倍实时运行,平均IoU分别为0.84和0.82。手部检测器在0.5 IoU下取得72%的平均精度(AP);利用最优数据增强参数将检测结果提升至81%。该手部检测器以4.7倍实时运行,在0.5 IoU下AP为81%。手部检测方法结合投影与聚类以生成精确候选框,该方案将误检手部数量减少80%。整体手部检测系统以4倍实时运行,捕获当前协作组的所有活动区域。
引用
@article{arxiv.2106.07556,
title = {Long Term Object Detection and Tracking in Collaborative Learning Environments},
author = {Sravani Teeparthi},
journal= {arXiv preprint arXiv:2106.07556},
year = {2021}
}
备注
Master's thesis