EAGLE:增强的视觉定位最小化指令多模态模型中的幻觉
计算机视觉与模式识别
2025-01-07 v1 人工智能
摘要
大型语言模型和视觉 Transformer 展示了令人印象深刻的零样本能力,使其在下游任务中具有显著的迁移性。这些模型的融合产生了具有增强指令能力的多模态架构。尽管结合了海量的图像和语言预训练,这些多模态架构生成的响应往往偏离图像数据中的真实情况。这些失败案例被称为幻觉。当前缓解幻觉的方法通常侧重于正则化语言组件、改进融合模块,或集成多个视觉编码器以改善视觉表示。在本文中,我们通过直接增强视觉组件的能力来解决幻觉问题。我们的方法名为 EAGLE,对 LLM 或融合模块完全不可知,作为一种预训练后方法工作,可改善视觉编码器的定位和语言对齐。我们表明,对原始对比预训练任务进行简单的重新表述,可以得到一个改进的视觉编码器,该编码器可以合并到指令多模态架构中,而无需额外的指令训练。因此,EAGLE 在多个具有挑战性的基准和任务中显著减少了幻觉。
引用
@article{arxiv.2501.02699,
title = {EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models},
author = {Andrés Villa and Juan León Alcázar and Motasem Alfarra and Vladimir Araujo and Alvaro Soto and Bernard Ghanem},
journal= {arXiv preprint arXiv:2501.02699},
year = {2025}
}
备注
12 pages, 4 figures, 8 tables