交通场景中视觉语言模型的幻觉消除与语义增强框架
计算机视觉与模式识别
2024-12-11 v1
摘要
大视觉语言模型(LVLMs)在多模态理解和生成任务中展示了显著的能力。然而,这些模型偶尔会生成幻觉性文本,导致生成看似合理但与图像不对应的描述。这种现象可能导致自动驾驶系统的错误驾驶决策。为应对这一挑战,本文提出了HCOENet,一种即插即用的思维链校正方法,旨在消除对象幻觉并为初始响应中遗漏的关键对象生成增强描述。具体而言,HCOENet采用交叉检查机制来过滤实体,并直接从给定图像中提取关键对象,丰富描述文本。在POPE基准上的实验结果表明,HCOENet分别将Mini-InternVL-4B和mPLUG-Owl3模型的F1分数提升了12.58%和4.28%。此外,使用在开放校园场景收集的图像进行的定性结果进一步突出了所提出方法的实际适用性。与GPT-4o模型相比,HCOENet在保持相当描述性能的同时显著降低了成本。最后,创建了两个新的语义理解数据集CODA_desc和nuScenes_desc,用于交通场景以支持未来研究。代码和数据集在https://github.com/fjq-tongji/HCOENet公开发布。
引用
@article{arxiv.2412.07518,
title = {Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios},
author = {Jiaqi Fan and Jianhua Wu and Hongqing Chu and Quanbo Ge and Bingzhao Gao},
journal= {arXiv preprint arXiv:2412.07518},
year = {2024}
}