中文

人工标注的有效替代:工业 NLP 中大语言模型的集成分歧分数

计算与语言 2023-11-21 v2

摘要

大语言模型(LLMs)已展现出在大量 NLP 任务上泛化的显著能力。对于工业应用,必须不时评估 LLM 在未标注生产数据上的表现,以验证其在真实场景中的有效性。用于评估模型误差的人工标注需要可观的费用和时间延迟。在此,我们证明集成分歧分数在零样本、少样本和微调设定下,作为语言模型人工标注的替代指标表现良好,这是我们基于关键词抽取(KPE)任务的评估所得。我们通过与人标真实标注测算出的真实误差相比较,衡量结果保真度。我们对比了使用另一 LLM 作为机器标注或银标注来源的替代方案。跨多种语言和领域的结果表明,分歧分数能更好地估计模型性能,其平均绝对误差(MAE)低至 0.4%,且平均比使用银标注好 13.8%。

关键词

引用

@article{arxiv.2309.05619,
  title  = {Effective Proxy for Human Labeling: Ensemble Disagreement Scores in Large Language Models for Industrial NLP},
  author = {Wei Du and Laksh Advani and Yashmeet Gambhir and Daniel J Perry and Prashant Shiralkar and Zhengzheng Xing and Aaron Colak},
  journal= {arXiv preprint arXiv:2309.05619},
  year   = {2023}
}

备注

Camera ready version for 2023 EMNLP (The Third Workshop on Natural Language Generation, Evaluation, and Metrics (GEM))