中文

通过多智能体辩论解读和缓解MLLM中的幻觉

计算机视觉与模式识别 2024-07-31 v1

摘要

MLLM经常生成与视觉内容不一致的输出,这一挑战被称为幻觉。先前的方法侧重于判断生成的输出是否为幻觉,而未识别导致幻觉的图像区域或解释此类幻觉发生的原因。在本文中,我们论证MLLM中的幻觉部分是由于这些模型缺乏慢思考和发散思考。为解决这一问题,我们提出采用自反思方案来促进慢思考。此外,我们将消除幻觉视为一个复杂的推理任务,并提出多智能体辩论方法来鼓励发散思考。因此,我们的方法不仅能够缓解幻觉,还能解释幻觉为何发生并详细说明幻觉的具体细节。此外,我们提出在MLLM的语境中区分创造力与幻觉,并说明如何评估MLLM的创造力能力。在各种基准上的广泛实验证明我们的方法在多个MLLM上展现了泛化的幻觉缓解性能。

关键词

引用

@article{arxiv.2407.20505,
  title  = {Interpreting and Mitigating Hallucination in MLLMs through Multi-agent Debate},
  author = {Zheng Lin and Zhenxing Niu and Zhibin Wang and Yinghui Xu},
  journal= {arXiv preprint arXiv:2407.20505},
  year   = {2024}
}