中文

大语言模型在维基百科式综述生成上的表现:以 NLP 概念为对象的评估

计算与语言 2024-05-24 v4

摘要

计算机科学等专门领域的综述文章等教材传统上需要大量专家投入,因而创作与更新成本高昂。近期,大语言模型 (LLMs) 在各种通用任务上取得显著成功。然而,它们在教育领域的有效性与局限尚待充分探索。本工作中,我们考察 LLMs 在计算机科学 NLP 这一细分领域生成简明综述文章的能力,聚焦于精心整理的 99 个主题。自动化基准显示,相较既定真值,GPT-4 以 2% 至 20% 的幅度超越其前代,包括 GPT-3.5、PaLM2 与 LLaMa2。我们比较了人工与基于 GPT 的评分数,并给出深入分析。尽管结果表明 GPT 生成的综述比人工撰写的更具时效性与易读性,仍观察到若干局限。值得注意的是,GPT-4 虽常给出出色内容,偶尔也会出现遗漏细节或事实错误等疏失。最后,我们比较了人类与 GPT-4 的评分行为,发现使用 GPT 评估时存在系统性偏差。

关键词

引用

@article{arxiv.2308.10410,
  title  = {Large Language Models on Wikipedia-Style Survey Generation: an Evaluation in NLP Concepts},
  author = {Fan Gao and Hang Jiang and Rui Yang and Qingcheng Zeng and Jinghui Lu and Moritz Blum and Dairui Liu and Tianwei She and Yuang Jiang and Irene Li},
  journal= {arXiv preprint arXiv:2308.10410},
  year   = {2024}
}