TrafficVLM:一种用于交通视频描述的可控视觉语言模型
计算机视觉与模式识别
2024-06-18 v1 人工智能
计算与语言
机器学习
摘要
由于对高效可靠的城市监控系统需求日益增长,交通视频描述与分析近来备受关注。现有方法大多仅侧重于定位交通事件片段,严重缺乏与事件中所有关注对象的行为和上下文相关的描述性细节。在本文中,我们提出了TrafficVLM,这是一种新颖的、面向车辆自车摄像头视角的多模态密集视频描述模型。TrafficVLM在空间和时间上对不同分析层面的交通视频事件进行建模,并为事件不同阶段的车辆和行人生成细粒度的长描述。我们还为TrafficVLM提出了一个条件组件来控制生成输出,以及一个多任务微调范式来增强TrafficVLM的学习能力。实验表明,TrafficVLM在车辆和俯视摄像头视角下均表现良好。我们的解决方案在2024年AI城市挑战赛的赛道2中取得了优异成绩,在挑战赛排行榜上位列第三。我们的代码已在https://github.com/quangminhdinh/TrafficVLM上公开。
引用
@article{arxiv.2404.09275,
title = {TrafficVLM: A Controllable Visual Language Model for Traffic Video Captioning},
author = {Quang Minh Dinh and Minh Khoi Ho and Anh Quan Dang and Hung Phong Tran},
journal= {arXiv preprint arXiv:2404.09275},
year = {2024}
}