中文

视觉语言模型能否取代人类标注者:以CelebA数据集为例的案例研究

计算机视觉与模式识别 2024-10-15 v1 人工智能

摘要

本研究通过比较视觉语言模型(VLMs)在CelebA数据集上的性能与人工标注的质量和成本效益,评估了其在图像数据标注方面的能力。来自最先进的LLaVA-NeXT模型对1000张CelebA图像的标注与原始人工标注的一致性达到79.5%。将不一致案例的重新标注纳入多数投票后,AI标注的一致性提升至89.1%,对于更客观的标签则更高。成本评估表明,与传统人工方法相比,AI标注显著降低了支出——仅占CelebA数据集中人工标注成本的不到1%。这些发现支持了VLMs作为特定标注任务可行且具有成本效益的替代方案的潜力,减少了与大规模人工数据标注相关的财务负担和伦理问题。本研究中使用的AI标注和重新标注可在 https://github.com/evev2024/EVEV2024_CelebA 获取。

关键词

引用

@article{arxiv.2410.09416,
  title  = {Can Vision-Language Models Replace Human Annotators: A Case Study with CelebA Dataset},
  author = {Haoming Lu and Feifei Zhong},
  journal= {arXiv preprint arXiv:2410.09416},
  year   = {2024}
}

备注

Accepted by NeurIPS 2024 Workshop (EvalEval 2024)