鹦鹉困境:分类任务中人工标注数据与 LLM 增强数据的比较
计算与语言
2024-02-06 v2 计算机与社会
物理与社会
摘要
在计算社会科学(CSS)领域,从业者常需应对复杂、低资源的领域,并面临获取数据与标注成本高昂且耗时的挑战。我们旨在建立一套指南以应对此类挑战,在十个复杂度各异的 CSS 分类任务中比较人工标注数据与由 GPT-4 和 Llama-2 合成生成数据的使用。此外,我们考察了训练数据规模对性能的影响。我们的发现表明,在人工标注数据上训练的模型始终表现出优于或可与合成增强对应模型相媲美的性能。然而,合成增强被证明是有益的,特别是在提升多类任务中稀有类的性能方面。进一步,我们利用 GPT-4 和 Llama-2 进行零样本分类,发现尽管它们通常表现出强劲性能,但与在中等规模训练集上训练的专业分类器相比往往有所不及。
引用
@article{arxiv.2304.13861,
title = {The Parrot Dilemma: Human-Labeled vs. LLM-augmented Data in Classification Tasks},
author = {Anders Giovanni Møller and Jacob Aarup Dalsgaard and Arianna Pera and Luca Maria Aiello},
journal= {arXiv preprint arXiv:2304.13861},
year = {2024}
}
备注
Accepted at EACL 2024. 14 pages, 4 figures, 2 tables