CityLLaVA:面向城市场景的视觉语言模型高效微调
计算机视觉与模式识别
2024-05-07 v1
摘要
在广阔且动态的都市场景中,交通安全描述与分析在从保险检查到事故预防等应用中发挥着关键作用。本文介绍了 CityLLaVA,一个用于城市场景的视觉语言模型(VLM)新颖微调框架。CityLLaVA 通过(1)采用边界框进行最佳视觉数据预处理,包括视频最佳视角选择和视觉提示工程;(2)构建简洁的问答序列并设计文本提示以细化指令理解;(3)实施块级扩展以高效微调大型 VLM;(4)通过独特的基于顺序提问的预测增强方法提高预测准确性。我们的方法展现了顶级性能,基准得分为 33.4308,位于领军位置。代码可查阅:https://github.com/alibaba/AICITY2024_Track2_AliOpenTrek_CityLLaVA
引用
@article{arxiv.2405.03194,
title = {CityLLaVA: Efficient Fine-Tuning for VLMs in City Scenario},
author = {Zhizhao Duan and Hao Cheng and Duo Xu and Xi Wu and Xiangxie Zhang and Xi Ye and Zhen Xie},
journal= {arXiv preprint arXiv:2405.03194},
year = {2024}
}
备注
Accepted by AICITY2024 Workshop Track2 at CVPR2024