自动为多模态大语言模型生成视觉幻觉测试用例
计算机视觉与模式识别
2024-10-16 v1 人工智能
机器学习
摘要
当多模态大语言模型 (MLLM) 为给定提示生成包含不正确视觉细节的响应时,便会发生视觉幻觉 (VH)。现有生成 VH 测试用例的方法主要依赖人工标注,通常以三元组形式呈现:(图像、问题、答案)。本文首次提出一种自动化 VH 测试用例扩展方法——VHExpansion。给定初始 VH 测试用例后,VHExpansion 通过否定方式扰动问题和答案,并通过常规和对抗性扰动修改图像,从而自动扩展该测试用例。此外,我们提出了一种新评估指标——对称准确率 (symmetric accuracy),用于衡量正确回答 VH 测试用例对的比例。该对偶由一个测试用例及其否定版本组成。我们的理论分析表明,对称准确率是一种无偏评估指标,当 MLLM 随机猜测答案时,能保持不受 VH 测试用例答案不平衡的影响,而传统准确率则容易受此影响。我们将 VHExpansion 应用于扩充三个人工标注的 VH 数据集,并用于对七种 MLLM 进行基准测试。我们的评估表明,VHExpansion 能有效识别更多 VH 测试用例。此外,由于对称准确率无偏,能够得出关于 MLLM 针对 VH 脆弱性的不同结论。最后,我们展示了在 VHExpansion 生成的扩充数据集上微调 MLLM 能更有效地缓解 VH,而这在使用原始人工标注数据集上微调则效果较差。我们的代码已公开:https://github.com/lycheeefish/VHExpansion。
引用
@article{arxiv.2410.11242,
title = {Automatically Generating Visual Hallucination Test Cases for Multimodal Large Language Models},
author = {Zhongye Liu and Hongbin Liu and Yuepeng Hu and Zedian Shao and Neil Zhenqiang Gong},
journal= {arXiv preprint arXiv:2410.11242},
year = {2024}
}