视觉语言模型能否取代人类标注者:以CelebA数据集为例的案例研究
计算机视觉与模式识别
2024-10-15 v1 人工智能
摘要
本研究通过比较视觉语言模型(VLMs)在CelebA数据集上的性能与人工标注的质量和成本效益,评估了其在图像数据标注方面的能力。来自最先进的LLaVA-NeXT模型对1000张CelebA图像的标注与原始人工标注的一致性达到79.5%。将不一致案例的重新标注纳入多数投票后,AI标注的一致性提升至89.1%,对于更客观的标签则更高。成本评估表明,与传统人工方法相比,AI标注显著降低了支出——仅占CelebA数据集中人工标注成本的不到1%。这些发现支持了VLMs作为特定标注任务可行且具有成本效益的替代方案的潜力,减少了与大规模人工数据标注相关的财务负担和伦理问题。本研究中使用的AI标注和重新标注可在 https://github.com/evev2024/EVEV2024_CelebA 获取。
引用
@article{arxiv.2410.09416,
title = {Can Vision-Language Models Replace Human Annotators: A Case Study with CelebA Dataset},
author = {Haoming Lu and Feifei Zhong},
journal= {arXiv preprint arXiv:2410.09416},
year = {2024}
}
备注
Accepted by NeurIPS 2024 Workshop (EvalEval 2024)