中文

FreeAL:大语言模型时代迈向无人工主动学习

计算与语言 2023-11-28 v1

摘要

为模型训练收集高质量标注数据在各种自然语言处理(NLP)任务中众所周知地耗时且费力。尽管已提出大量方案,例如针对小语言模型(SLM)的主动学习以及大语言模型(LLM)时代普遍的上下文学习,并在一定程度上缓解了标注负担,但其性能仍受人为干预限制。如何在LLM时代降低标注成本仍待深入探索。为此,我们革新传统主动学习,提出一种创新的协作学习框架FreeAL,以交互式地从LLM中提炼并过滤任务特定知识。在协作训练中,LLM充当主动标注器灌输其粗粒度知识,而下游SLM作为学生过滤出高质量上下文样本,反馈给LLM以进行后续标签精炼。在八个基准数据集上的大量实验表明,FreeAL在无任何人类监督的情况下大幅提升了SLM和LLM的零样本性能。代码见 https://github.com/Justherozen/FreeAL 。

关键词

引用

@article{arxiv.2311.15614,
  title  = {FreeAL: Towards Human-Free Active Learning in the Era of Large Language Models},
  author = {Ruixuan Xiao and Yiwen Dong and Junbo Zhao and Runze Wu and Minmin Lin and Gang Chen and Haobo Wang},
  journal= {arXiv preprint arXiv:2311.15614},
  year   = {2023}
}

备注

Accepted to EMNLP 2023 (Main conference)