中文

通过鲁棒指令微调缓解大型多模态模型中的幻觉

计算机视觉与模式识别 2024-03-21 v4 人工智能 计算工程、金融与科学 计算与语言 多媒体

摘要

尽管在多模态任务上取得了可喜进展,当前大型多模态模型(LMMs)易于产生相对于关联图像和人类指令不一致描述的幻觉。本文通过引入首个大型且多样的视觉指令微调数据集,名为大规模鲁棒视觉(LRV)-Instruction,来解决此问题。我们的数据集包含由GPT4生成的40万条视觉指令,涵盖16个视觉与语言任务,具有开放式指令与答案。与主要关注正指令样本的现有研究不同,我们设计LRV-Instruction以包含正指令与负指令,从而实现更鲁棒的视觉指令微调。我们的负指令设计于三个语义层级:(i)不存在对象操控,(ii)存在对象操控,以及(iii)知识操控。为高效度量LMMs生成的幻觉,我们提出GPT4辅助视觉指令评估(GAVIE),一种像人类专家一样评估视觉指令微调的稳定方法。GAVIE不需要人工标注的真值答案,并可适应多样的指令格式。我们进行综合实验以研究LMMs的幻觉。我们的结果表明,现有LMMs在呈现我们的负指令时表现出显著幻觉,尤其是存在对象与知识操控指令。此外,我们通过在LRV-Instruction上微调MiniGPT4和mPLUG-Owl成功缓解了幻觉,同时相较于最先进方法在数个公开数据集上提升了性能。另外,我们观察到训练数据中正负实例的平衡比例会带来更鲁棒的模型。代码与数据可在 https://github.com/FuxiaoLiu/LRV-Instruction 获取。

关键词

引用

@article{arxiv.2306.14565,
  title  = {Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning},
  author = {Fuxiao Liu and Kevin Lin and Linjie Li and Jianfeng Wang and Yaser Yacoob and Lijuan Wang},
  journal= {arXiv preprint arXiv:2306.14565},
  year   = {2024}
}

备注

40 pages, 32 figures, ICLR 2024