反思指令调优:缓解大型视觉语言模型中的幻觉
计算与语言
2024-07-17 v1
摘要
大型视觉语言模型(LVLMs)在 various vision-language tasks 上表现突出。然而,它们仍然容易受到幻觉影响,生成与视觉内容或指令不符的输出。虽然提出了各种缓解策略,但往往忽视了一个关键因素:在训练期间缺乏细粒度推理监督。没有中间推理步骤,模型可能会在指令和响应之间建立浅层捷径,无法内化固有的推理逻辑。为解决此挑战,我们提出反思指令调优,将理由学习集成到视觉指令调优中。与之前仅从响应中学习的方法不同,我们的方法要求模型预测解释响应正确或错误的理由。这促进了对每个响应背后细粒度推理的更深入参与,从而增强了模型的推理能力。为支持此方法,我们提出 REVERIE,即首个带有反思理由注释的大规模指令调优数据集。REVERIE 包含 115k 个机器生成的推理指令,每个指令都配有一对正确和令人困惑的响应,以及详尽的理由,阐明每个响应正确或错误的原因。在多个 LVLMs 基准测试中实验结果表明,采用 REVERIE 数据集进行反思指令调优相对于基线模型显著提升性能,显示示了反思从理由中获得效果的有效性。项目页面位于 https://zjr2000.github.io/projects/reverie。
关键词
引用
@article{arxiv.2407.11421,
title = {States Hidden in Hidden States: LLMs Emerge Discrete State Representations Implicitly},
author = {Junhao Chen and Shengding Hu and Zhiyuan Liu and Maosong Sun},
journal= {arXiv preprint arXiv:2407.11421},
year = {2024}
}