中文

VERITAS:利用视觉先验与专家融合提升多模态数据质量

人工智能 2025-10-20 v1

摘要

监督微调 (SFT) 数据的质量对于大型多模态模型 (LMM) 的性能至关重要,但当前的数据增强方法常因视觉感知不足导致事实错误和幻觉。为此,我们提出了 VERITAS,一个系统性地整合视觉先验和多个最先进 LMM 的管道,以提高 SFT 数据质量。VERITAS 利用视觉识别模型 (RAM++) 和 OCR 系统 (PP-OCRv4) 提取结构化视觉先验,这些先验与图像、问题和答案相结合。三 个 LMM (GPT-4o、Gemini-2.5-Pro、豆包-1.5-pro) 对原始答案进行评估,提供批判性理由和分数,这些分数经统计方法融合后成为作为真实答案的高置信度共识分数。利用此共识,我们通过组相对政策优化 (GRPO) 训练一个轻量级批判模型,高效提升推理能力。随后,每个 LMM 根据批判性意见细化原始答案,生成新的候选答案;我们选择得分最高的答案作为最终细化后的答案。跨六个多模态基准的实验表明,使用 VERITAS 处理后的数据微调的模型在各类任务中一致优于使用原始数据的模型,尤其在文本丰富和细粒度推理任务中表现突出。我们的批判模型在能力上相当于最先进的 LMM,同时显著更高效。我们发布了该管道、数据集和模型检查点,以推动多模态数据优化领域的研究进展。

关键词

引用

@article{arxiv.2510.15317,
  title  = {VERITAS: Leveraging Vision Priors and Expert Fusion to Improve Multimodal Data},
  author = {Tingqiao Xu and Ziru Zeng and Jiayu Chen},
  journal= {arXiv preprint arXiv:2510.15317},
  year   = {2025}
}

备注

Accepted to EMNLP 2025 (Main Conference)