中文

CIEM:用于改进指令微调的对比指令评估方法

计算机视觉与模式识别 2023-11-27 v2

摘要

如今,得益于大语言模型(LLM)的成功,大视觉-语言模型(LVLM)的研究得到了显著推动。然而,这些视觉-语言模型(VLM)存在幻觉这一缺陷——由于对视觉与语言模态理解不足,VLM在进行下游应用时会生成错误的感知信息,例如描述不存在的实体。为应对幻觉现象,一方面,我们引入对比指令评估方法(CIEM),这是一种自动流水线,利用标注的图像-文本数据集结合LLM生成事实性/对比性问答对,以评估VLM的幻觉。另一方面,基于CIEM,我们进一步提出一种称为CIT(Contrastive Instruction Tuning,对比指令微调的缩写)的新指令微调方法,通过自动生成高质量的事实性/对比性问答对及相应解释用于模型微调,从而缓解VLM的幻觉。通过在CIEM和CIT上的大量实验,我们指出了现有VLM中普遍存在的幻觉问题、当前指令微调数据集处理幻觉现象能力的不足,以及CIT微调的VLM相对于CIEM和公开数据集的优越性。

关键词

引用

@article{arxiv.2309.02301,
  title  = {CIEM: Contrastive Instruction Evaluation Method for Better Instruction Tuning},
  author = {Hongyu Hu and Jiyuan Zhang and Minyi Zhao and Zhenbang Sun},
  journal= {arXiv preprint arXiv:2309.02301},
  year   = {2023}
}