中文

今日大语言模型研究中的亮点、法律与漏洞

计算与语言 2025-06-03 v3

摘要

我们对当代大语言模型(LLM)研究的科学方法进行批判性检讨。为此,我们根据典型被视为良好研究的标准(例如统计检验和可重复性的存在),评估了自2020年至2024年发布的超过2000项研究工作,并将其与置于争议中心的论点(例如涌现行为的主张)进行交叉验证。我们发现多个趋势,例如伦理声明数量的下降、LLM作为评估工具的增多,以及在不依赖人类评估的情况下对LLM推理能力的主张增加。我们指出,虽然会议清单在遏制某些问题方面是有效的,但在研究中平衡速度与严谨性不能仅仅依赖这些措施。我们将这些发现与来自最近综述性研究的发现联系起来,并对如何解决LLM研究中该做、不做以及应该做的事进行了延伸性建议。

关键词

引用

@article{arxiv.2408.15409,
  title  = {Awes, Laws, and Flaws From Today's LLM Research},
  author = {Adrian de Wynter},
  journal= {arXiv preprint arXiv:2408.15409},
  year   = {2025}
}

备注

Accepted to ACL 2025 (Findings)