DeepLocalization:利用变点检测进行时序动作定位
计算机视觉与模式识别
2025-06-12 v1
摘要
在本研究中,我们介绍了 DeepLocalization,一个专为实时定位驾驶员行为动作而设计的创新框架。利用先进深度学习方法的强大能力,我们的目标是解决分心驾驶这一导致道路交通事故的重要因素。我们的策略采用双重方法:利用基于图的变点检测来精确定位动作的时间点,同时结合视频大语言模型(Video-LLM)来精确分类活动。通过精心设计的提示工程,我们定制了 Video-LLM 以熟练处理驾驶活动的细微差别,确保其在数据稀疏的情况下也能有效分类。我们的框架设计轻量,针对消费级 GPU 进行了优化,使其在实际场景中具有广泛适用性。我们在 SynDD2 数据集(一个复杂的分心驾驶行为基准)上对方法进行了严格测试,取得了令人满意的性能——事件分类准确率达到 57.5%,事件检测准确率达到 51%。这些结果凸显了 DeepLocalization 在有限计算资源下准确识别不同驾驶员行为及其时间发生点的巨大潜力。
引用
@article{arxiv.2404.12258,
title = {DeepLocalization: Using change point detection for Temporal Action Localization},
author = {Mohammed Shaiqur Rahman and Ibne Farabi Shihab and Lynna Chu and Anuj Sharma},
journal= {arXiv preprint arXiv:2404.12258},
year = {2025}
}