今日大语言模型研究中的亮点、法律与漏洞
计算与语言
2025-06-03 v3
摘要
我们对当代大语言模型(LLM)研究的科学方法进行批判性检讨。为此,我们根据典型被视为良好研究的标准(例如统计检验和可重复性的存在),评估了自2020年至2024年发布的超过2000项研究工作,并将其与置于争议中心的论点(例如涌现行为的主张)进行交叉验证。我们发现多个趋势,例如伦理声明数量的下降、LLM作为评估工具的增多,以及在不依赖人类评估的情况下对LLM推理能力的主张增加。我们指出,虽然会议清单在遏制某些问题方面是有效的,但在研究中平衡速度与严谨性不能仅仅依赖这些措施。我们将这些发现与来自最近综述性研究的发现联系起来,并对如何解决LLM研究中该做、不做以及应该做的事进行了延伸性建议。
引用
@article{arxiv.2408.15409,
title = {Awes, Laws, and Flaws From Today's LLM Research},
author = {Adrian de Wynter},
journal= {arXiv preprint arXiv:2408.15409},
year = {2025}
}
备注
Accepted to ACL 2025 (Findings)