通过对抗指令微调缓解大型视觉语言模型的对话幻觉
计算机视觉与模式识别
2024-10-07 v3
摘要
缓解大型视觉语言模型(LVLMs)的幻觉对于提升其作为通用助手的可靠性至关重要。本文表明,LVLMs 的这种幻觉可能会被先前的用户-系统对话显著加剧。为了精确衡量这一点,我们首先提出了一个评估基准,通过使用我们新颖的对抗问题生成器(AQG)在流行的多模态基准数据集中前置幻觉对话来扩展它们,AQG 可以通过对 LVLMs 采用对抗攻击自动生成与图像相关但具有对抗性的对话。在我们的基准上,SOTA LVLMs 在 VQA 和 Captioning 任务上的零样本性能均显著下降。接着,我们进一步揭示这种幻觉主要是由于对先前对话的预测偏差,而非视觉内容。为了减少这种偏差,我们提出了对抗指令微调(AIT),针对幻觉对话对 LVLMs 进行稳健的微调。大量实验表明,我们提出的方法成功减少了对话幻觉,同时保持了性能。
引用
@article{arxiv.2403.10492,
title = {Mitigating Dialogue Hallucination for Large Vision Language Models via Adversarial Instruction Tuning},
author = {Dongmin Park and Zhaofang Qian and Guangxing Han and Ser-Nam Lim},
journal= {arXiv preprint arXiv:2403.10492},
year = {2024}
}