中文

利用并行密集视频描述进行端到端事件分析以增强交通安全

计算机视觉与模式识别 2024-04-15 v1

摘要

本文介绍了我们针对 AI City Challenge 2024 中 Track 2 的解决方案。该任务旨在利用 Woven Traffic Safety (WTS) 数据集解决交通安全描述与分析问题,WTS 是一个用于细粒度时空理解的真实世界以行人为中心的交通视频数据集。我们的解决方案主要侧重于以下几点:1) 为了解决密集视频描述问题,我们利用具有并行解码的密集视频描述框架(PDVC)来建模视觉语言序列,并按章节为视频生成密集描述。2) 我们的工作利用 CLIP 提取视觉特征,以更高效地在视觉表示和文本表示之间进行跨模态训练。3) 我们进行特定领域的模型适配,以缓解在视频理解中造成识别挑战的领域偏移问题。4) 此外,我们利用带描述的 BDD-5K 视频进行知识迁移,以更好地理解 WTS 视频并实现更准确的描述。我们的解决方案在测试集上取得了竞赛第 6 名的成绩。开源代码将发布于 https://github.com/UCF-SST-Lab/AICity2024CVPRW

关键词

引用

@article{arxiv.2404.08229,
  title  = {Enhancing Traffic Safety with Parallel Dense Video Captioning for End-to-End Event Analysis},
  author = {Maged Shoman and Dongdong Wang and Armstrong Aboah and Mohamed Abdel-Aty},
  journal= {arXiv preprint arXiv:2404.08229},
  year   = {2024}
}