中文

隐藏克隆体:揭示和修复视觉语言模型集合中的家族偏差

计算机视觉与模式识别 2026-03-19 v1 人工智能

摘要

从不同提供商 ensembles 视觉语言模型(VLMs)可最大化基准准确率,但来自相同架构家族的模型共享相关错误,标准投票忽略这一点。我们在 VQAv2、TextVQA 和 GQA 上 study 17 个来自 8 个家族的 VLMs。家族相关错误将有效 ensemble 维度降至 2.5-3.6 个独立投票者,并创建了一个误导性等级(占问题的 1.5-6.5%),其中相关多数错误在最佳模型正确时仍将准确率降至 0%。我们提出了三种家族感知方法。层次化家族投票(HFV)在家族内部聚合后再进行跨家族投票,使误导性等级获得 +18-26 pp 的恢复。QualRCCV 是一种基于校准、家族质量和逆家族大小加权的训练-free 方法,是在所有三个基准上超越校准投票的首个方法(p<0.05)。Learned Candidate Scoring(LCS)训练一个交叉验证分类器来重新排序候选答案,利用支持广度、家族多样性和模型质量,实现了最大的收益:+0.68% VQAv2、+0.61% TextVQA、+2.45% GQA——所有都显著——且是唯一不会在任何基准上降低的学习方法。在 VQAv2 test-standard(EvalAI)上,LCS 达到 87.83%,使用 12 个模型,确认了泛化性。

关键词

引用

@article{arxiv.2603.17111,
  title  = {Hidden Clones: Exposing and Fixing Family Bias in Vision-Language Model Ensembles},
  author = {Zacharie Bugaud},
  journal= {arXiv preprint arXiv:2603.17111},
  year   = {2026}
}

备注

15 pages, 6 figures, 11 tables