中文

人类仍胜过大语言模型:领域特定标注任务中主动学习的实证研究

计算与语言 2023-11-17 v1

摘要

大语言模型(LLMs)已展现出显著进展,并有若干关于其超越人类性能的说法。然而,在现实世界任务中,往往需要具备领域知识。诸如主动学习(AL)等低资源学习方法已被提出以应对领域专家标注的成本,这引发了一个问题:在领域特定任务中,LLMs 能否超越使用专家标注训练的小型模型?在本工作中,我们在来自三个不同领域的四个数据集上进行了实证实验,将 SOTA LLMs 与通过 AL 利用专家标注训练的小型模型进行比较。我们发现,小型模型仅需数百条标注数据即可优于 GPT-3.5,并且尽管它们规模小数百倍,却能与 GPT-4 取得更高或相近的性能。基于这些发现,我们假定 LLM 预测可作为实际应用中的预热方法,而在涉及领域特定知识驱动的数据标注任务中,人类专家仍不可或缺。

关键词

引用

@article{arxiv.2311.09825,
  title  = {Human Still Wins over LLM: An Empirical Study of Active Learning on Domain-Specific Annotation Tasks},
  author = {Yuxuan Lu and Bingsheng Yao and Shao Zhang and Yun Wang and Peng Zhang and Tun Lu and Toby Jia-Jun Li and Dakuo Wang},
  journal= {arXiv preprint arXiv:2311.09825},
  year   = {2023}
}