通过字幕重写微调大型视觉语言模型以缓解细粒度幻觉
计算机视觉与模式识别
2023-12-05 v1 计算与语言
摘要
大型语言模型(LLM)在自然语言处理(NLP)任务中表现出色。为了理解和执行图像数据上的多样化人类指令,引入了经过指令微调的大型视觉语言模型(LVLM)。然而,LVLM 可能会遭受不同类型的物体幻觉。尽管如此,LVLM 仅针对粗粒度物体幻觉进行评估(即生成的物体在输入图像中不存在)。图像中不存在的细粒度物体属性和行为仍可能被生成,但未被当前评估方法衡量。因此,本文专注于减少 LVLM 的细粒度幻觉。我们提出了 ReCaption 框架,该框架包含两个组件:使用 ChatGPT 重写字幕,以及在重写的字幕上微调经过指令微调的 LVLM。我们还提出了一种基于细粒度探测的评估方法,名为细粒度物体幻觉评估(FGHE)。我们的实验结果表明,ReCaption 能有效减少不同 LVLM 选项的细粒度物体幻觉,并提高其文本生成质量。代码可在 https://github.com/Anonymousanoy/FOHE 获取。
引用
@article{arxiv.2312.01701,
title = {Mitigating Fine-Grained Hallucination by Fine-Tuning Large Vision-Language Models with Caption Rewrites},
author = {Lei Wang and Jiabang He and Shenshen Li and Ning Liu and Ee-Peng Lim},
journal= {arXiv preprint arXiv:2312.01701},
year = {2023}
}
备注
MMM 2024