如果……会怎样?:思考反事实关键词有助于缓解大型多模态模型中的幻觉
计算机视觉与模式识别
2024-06-24 v2 人工智能
计算与语言
摘要
本文提出了一种增强大型多模态模型(LMM)在解决幻觉问题上的可靠性的方法,幻觉是指模型生成跨模态不一致的响应。在无需额外训练的情况下,我们提出了反事实植入(Counterfactual Inception),这是一种利用自生成的反事实关键词将反事实思维植入 LMM 的新方法。我们的方法基于反事实思维的概念,这是一种人类考虑替代现实的认知过程,能够实现更广泛的上下文探索。通过将人类认知机制引入 LMM,我们旨在使模型参与并生成涵盖更广泛上下文场景理解的响应,从而缓解幻觉输出。我们进一步引入了合理性验证过程(PVP),这是一种简单而稳健的关键词约束,可有效过滤次优关键词,从而在模型响应中一致地触发反事实思维。对包括开源模型和专有模型在内的各种 LMM 的综合分析证实,反事实思维显著减少了幻觉,并有助于基于真实视觉线索拓宽上下文理解。
引用
@article{arxiv.2403.13513,
title = {What if...?: Thinking Counterfactual Keywords Helps to Mitigate Hallucination in Large Multi-modal Models},
author = {Junho Kim and Yeon Ju Kim and Yong Man Ro},
journal= {arXiv preprint arXiv:2403.13513},
year = {2024}
}
备注
Project page: https://ivy-lvlm.github.io/Counterfactual-Inception/