大规模cloze评估揭示:标记预测任务既不符合词汇也不符合语义
计算与语言
2024-10-29 v2 人工智能
摘要
本工作通过将语言模型在下一标记预测层面的生成行为与人类生产进行比较,评估了几个语言模型。我们发现,虽然经过更长时间训练的大型模型通常是人类生产的更好的估计器,但它们可靠地低估了人类响应的概率,对稀有响应的排序偏低,对常用响应的排序偏低,并且产生高度不同的语义空间。总体而言,本工作在可理解且可解释的领域中表明,LM生成不能用作替换或模型来评估cloze任务。
引用
@article{arxiv.2410.12057,
title = {Large-scale cloze evaluation reveals that token prediction tasks are neither lexically nor semantically aligned},
author = {Cassandra L. Jacobs and Loïc Grobol and Alvin Tsang},
journal= {arXiv preprint arXiv:2410.12057},
year = {2024}
}