中文

RITUAL:随机图像变换作为大型视觉语言模型通用抗幻觉杠杆

计算机视觉与模式识别 2024-12-17 v2 人工智能

摘要

近期大型视觉语言模型(LVLMs)的进展彻底改变了机器如何理解和生成基于视觉输入的文本响应,但它们常常产生“幻觉”输出,这些输出误解视觉信息,给可靠性和可信度带来挑战。我们提出 RITUAL,一种简单解码方法,通过在解码过程中利用随机变换后的图像作为补充输入来减少幻觉,在无需额外训练或外部模型的情况下调整输出概率分布。我们的关键洞察是,随机变换让模型接触多样化的视觉视角,从而纠正导致幻觉的误解。具体而言,当模型基于原始图像产生幻觉时,变换后的图像——按方向、比例或颜色等方面进行更改——提供了替代视角,有助于校准模型的预测。通过整合原始图像和变换后图像的概率分布,RITUAL 有效减少了幻觉。为进一步提高可靠性并解决由于任意变换可能导致的不稳定性,我们引入 RITUAL+,该方法根据 LVLM 的自反馈选择图像变换。不采用随机变换,而是让 RITUAL+ 使用 LVLM 来评估和选择最有助于减少特定情境下幻觉的变换。这种自适应方法缓解了特定变换对特定任务的潜在负面影响,确保在不同情景下表现更一致。实验结果表明,RITUAL 和 RITUAL+ 在多个对象幻觉基准测试中显著减少了幻觉。

关键词

引用

@article{arxiv.2405.17821,
  title  = {RITUAL: Random Image Transformations as a Universal Anti-hallucination Lever in Large Vision Language Models},
  author = {Sangmin Woo and Jaehyuk Jang and Donguk Kim and Yubin Choi and Changick Kim},
  journal= {arXiv preprint arXiv:2405.17821},
  year   = {2024}
}

备注

Project: https://sangminwoo.github.io/RITUAL/