基于Davidson场景图的自主式视觉语言模型幻觉评估框架FIHA
计算机视觉与模式识别
2025-06-04 v2
摘要
大型视觉语言模型(LVLMs)的快速发展常伴随广泛的幻觉问题,使得寻求高性价比且全面评估显得尤为重要。当前方法主要依赖昂贵的标注,且评估不全面——在评估诸如关系、属性及各方面之间的依赖关系方面。因此,我们引入FIHA(Autonomous Fine-graIned Hallucination evAluation),它能够以无需大语言模型和无需标注的方式访问幻觉LVLMs,并建模不同类型幻觉之间的依赖关系。FIHA可以在任何图像数据集上以最小成本生成Q&A对,实现从图像和标题两个维度进行幻觉评估。基于此方法,我们引入了一个基准称为FIHA-v1,包含来自MSCOCO和Foggy的多样化问题。我们使用Davidson场景图(DSG)组织Q&A对之间的结构,其中可提高评估的可靠性。我们使用FIHA-v1对代表性模型进行评估,凸显其局限性和挑战。我们已发布代码和数据。
引用
@article{arxiv.2409.13612,
title = {FIHA: Autonomous Hallucination Evaluation in Vision-Language Models with Davidson Scene Graphs},
author = {Bowen Yan and Zhengsong Zhang and Liqiang Jing and Eftekhar Hossain and Xinya Du},
journal= {arXiv preprint arXiv:2409.13612},
year = {2025}
}
备注
Accepted by Findings of ACL 2025