中文

LLM 在数据集标注中的前景与陷阱:以媒体偏见检测为例的案例研究

计算与语言 2025-01-27 v2

摘要

通过雇佣或众包带来的高昂标注成本,使得构建训练可靠文本分类器所需的大规模、高质量数据集变得复杂。近期研究表明,使用大语言模型(LLM)自动化标注过程可以在保持数据质量的同时降低这些成本。LLM 在仇恨言论检测和政治框架构建等下游任务标注中展现了可喜的成果。基于在这些领域的成功,本研究探讨了 LLM 是否适用于媒体偏见检测这一复杂任务的标注,以及是否可以在此类数据上训练下游媒体偏见分类器。我们构建了 annolexical,这是首个用于媒体偏见分类的大规模数据集,包含超过 48000 个合成标注样本。我们在此数据集上微调的分类器,在 Matthews 相关系数(MCC)上比所有用于标注的 LLM 高出 5-9 个百分点,并且在两个媒体偏见基准数据集(BABE 和 BASIL)上进行评估时,其表现接近或优于在人工标注数据上训练的模型。本研究展示了我们的方法如何显著降低媒体偏见领域数据集创建以及进而分类器开发的成本,同时我们后续的行为压力测试揭示了其当前的一些局限性与权衡。

关键词

引用

@article{arxiv.2411.11081,
  title  = {The Promises and Pitfalls of LLM Annotations in Dataset Labeling: a Case Study on Media Bias Detection},
  author = {Tomas Horych and Christoph Mandl and Terry Ruas and Andre Greiner-Petter and Bela Gipp and Akiko Aizawa and Timo Spinde},
  journal= {arXiv preprint arXiv:2411.11081},
  year   = {2025}
}