中文

面向视觉问答的人类不确定性感知数据选择与自动标注

计算机视觉与模式识别 2025-11-03 v2

摘要

大型视觉语言模型(VLM)在视觉问答任务中取得了强大的性能,但仍严重依赖于大规模人工标注数据集的监督微调 (SFT),由于人工标注成本较高。关键在于,现实世界的数据集常常存在人类不确定性(HU)——即不同标注者对同一样本的置信度存在差异——但标准的SFT仅优化 toward 最频繁的标签,忽略了HU分布。这留下了两个开放性问题:HU如何影响SFT,以及如何有效利用HU进行训练。本文首先对VLM在不同HU水平下的表现进行系统评估。我们发现:(i)令人惊讶的是,高HU样本贡献不大甚至会损害模型性能;(ii)直接在完整数据集上训练会导致模型在校准性方面不足,无法捕捉HU分布。基于这些发现,我们引入了HaDola——一个人类不确定性感知的数据选择与自动标注框架。HaDola包含四个阶段:判别、自标注、错误触发和训练,以迭代识别有害样本、优先选择信息丰富的样本,并从小规模种子数据集(占数据集5%)中进行自我标注。我们的 method 显著减少了对高成本HU标注的依赖,使VLM更准确且更好的校准。在VQAv2和VizWiz数据集上进行大规模实验表明,HaDola始终能够匹配或优于最新方法,同时使用更少的训练数据。我们的工作强调了在SFT中显式建模HU的重要性,表明更有效地利用HU比单纯扩大数据集规模更为关键。

关键词

引用

@article{arxiv.2510.11295,
  title  = {Human Uncertainty-Aware Data Selection and Automatic Labeling in Visual Question Answering},
  author = {Jian Lan and Zhicheng Liu and Udo Schlegel and Raoyuan Zhao and Yihong Liu and Hinrich Schütze and Michael A. Hedderich and Thomas Seidl},
  journal= {arXiv preprint arXiv:2510.11295},
  year   = {2025}
}