VGA:视觉 GUI 助手——通过图像中心微调最小化幻觉
计算机视觉与模式识别
2024-11-05 v3
摘要
最近的大型视觉语言模型(LVLMs)在格式化图表和富内容图像等图像理解任务方面取得了显著进展。然而,图形用户界面(GUI)因其结构化格式和详细文本信息而面临更大的挑战。现有的 LVLMs 过度依赖内部知识,忽视图像内容,导致在 GUI 理解中出现幻觉和错误响应。为此,我们引入了 VGA,一款为 GUI 理解而设计的微调模型。我们的模型旨在增强对 GUI 视觉数据的解释,减少幻觉。我们首先构建了一个包含 63.8 万高质量示例的视觉问答(VQA)数据集,采用我们提出的 Referent 方法,确保模型的响应高度依赖于图像中的视觉内容。随后,我们设计了两种阶段的微调方法,称为基础理解与高级理解(Foundation and Advanced Comprehension, FAC),以增强模型从图像内容中提取信息的能力,并与人类意图保持一致。实验表明,我们的方法提升了模型从图像中提取信息的能力,在 GUI 理解任务中实现了最先进的结果。我们的数据集和微调脚本将很快公开。
引用
@article{arxiv.2406.14056,
title = {VGA: Vision GUI Assistant -- Minimizing Hallucinations through Image-Centric Fine-Tuning},
author = {Ziyang Meng and Yu Dai and Zezheng Gong and Shaoxiong Guo and Minglong Tang and Tongquan Wei},
journal= {arXiv preprint arXiv:2406.14056},
year = {2024}
}
备注
Accepted by EMNLP2024