CIEM:用于改进指令微调的对比指令评估方法
计算机视觉与模式识别
2023-11-27 v2
摘要
如今,得益于大语言模型(LLM)的成功,大视觉-语言模型(LVLM)的研究得到了显著推动。然而,这些视觉-语言模型(VLM)存在幻觉这一缺陷——由于对视觉与语言模态理解不足,VLM在进行下游应用时会生成错误的感知信息,例如描述不存在的实体。为应对幻觉现象,一方面,我们引入对比指令评估方法(CIEM),这是一种自动流水线,利用标注的图像-文本数据集结合LLM生成事实性/对比性问答对,以评估VLM的幻觉。另一方面,基于CIEM,我们进一步提出一种称为CIT(Contrastive Instruction Tuning,对比指令微调的缩写)的新指令微调方法,通过自动生成高质量的事实性/对比性问答对及相应解释用于模型微调,从而缓解VLM的幻觉。通过在CIEM和CIT上的大量实验,我们指出了现有VLM中普遍存在的幻觉问题、当前指令微调数据集处理幻觉现象能力的不足,以及CIT微调的VLM相对于CIEM和公开数据集的优越性。
引用
@article{arxiv.2309.02301,
title = {CIEM: Contrastive Instruction Evaluation Method for Better Instruction Tuning},
author = {Hongyu Hu and Jiyuan Zhang and Minyi Zhao and Zhenbang Sun},
journal= {arXiv preprint arXiv:2309.02301},
year = {2023}
}