对症下药:通过针对性指令微调缓解大型视觉-语言模型中的幻觉
计算机视觉与模式识别
2025-06-05 v2 人工智能
摘要
尽管在各种跨模态任务上取得了出色性能,当前的大型视觉-语言模型(LVLMs)仍然存在幻觉问题,表现为其生成的响应与对应图像之间的不一致。先前的研究表明,指令数据的低质量,特别是正负样本之间的不平衡,是导致模型幻觉的重要因素。最近,研究人员提出了高质量的指令数据集,如LRV-Instruction,以缓解模型幻觉。然而,我们的调查发现,不同LVLMs的幻觉概念表现出特异性,即幻觉概念的分布在不同模型间差异显著。现有数据集在设计过程中未考虑不同模型的幻觉特异性,从而降低了它们在缓解模型幻觉方面的有效性。在本文中,我们提出了一种名为DFTG的针对性指令数据生成框架,该框架针对不同模型的幻觉特异性进行定制。具体地,DFTG包括两个阶段:幻觉诊断,从模型的响应和图像中提取必要信息进行幻觉诊断;以及针对性数据生成,基于诊断结果生成针对性指令数据。在幻觉基准上的实验结果表明,与以往数据集相比,我们的方法生成的针对性指令数据在缓解幻觉方面更有效。
引用
@article{arxiv.2404.10332,
title = {Prescribing the Right Remedy: Mitigating Hallucinations in Large Vision-Language Models via Targeted Instruction Tuning},
author = {Rui Hu and Yahan Tu and Shuyu Wei and Dongyuan Lu and Jitao Sang},
journal= {arXiv preprint arXiv:2404.10332},
year = {2025}
}
备注
Accepted in Information Sciences 2025