基于标签聚合的众包与大语言模型标注质量比较研究
计算与语言
2024-01-19 v1 人机交互
摘要
大语言模型(LLMs)是否能在数据标注任务上超越众包,近期引起了广泛关注。一些工作通过收集新数据集,针对特定 NLP 任务比较了个体众包工人和 LLM 工人的平均性能来验证这一问题。然而,一方面,现有用于众包标注质量研究的数据集尚未在此类评估中得到利用,这可能从不同角度提供可靠的评估。另一方面,这些聚合标签的质量至关重要,因为在使用众包时,最终收集的标签是从同一实例的多个众包标签中估计并聚合而成的。因此,在本文中,我们首先调查哪些现有众包数据集可用于比较研究并创建基准。随后,我们比较了个体众包标签与 LLM 标签的质量,并对聚合标签进行了评估。此外,我们提出了一种众包 -LLM 混合标签聚合方法并验证了其性能。我们发现,将优质 LLM 的标签添加到现有众包数据集中,可以提高数据集聚合标签的质量,且该质量高于 LLM 标签本身的质量。
引用
@article{arxiv.2401.09760,
title = {A Comparative Study on Annotation Quality of Crowdsourcing and LLM via Label Aggregation},
author = {Jiyi Li},
journal= {arXiv preprint arXiv:2401.09760},
year = {2024}
}
备注
Accepted in ICASSP 2024