中文

LongTail-Swap:评估语言模型在稀有词上的能力

计算与语言 2025-10-07 v1 人工智能

摘要

儿童学习语言时数据量较小,能在极少的示例中学习新词,因而是高度数据高效的学习者。BabyLM 挑战旨在探索语言模型(LM)在低数据 regime 下的训练,但使用的指标侧重于词分布的头部。本文引入 LongTail-Swap(LT-Swap),一个聚焦于分布尾部的基准测试,即衡量 LM 在极少暴露下学习新词的能力,如婴儿般。LT-Swap 是针对 pretraining 语料库的特定测试集,包含可接受与不可接受的句子对,以隔离稀有词的语义与语法用法。模型通过计算每对句子中平均对数概率来进行零样本评估。我们构建了分别关联 1000 万词和 1 亿词 BabyLM 训练集的两个测试集,并评估了来自 BabyLM 排行榜的 16 个模型。我们的结果不仅凸显了语言模型在稀有词上的表现差强人意,还揭示了在长尾区域 LM 架构之间的性能差异远大于在头部区域。这为哪些架构更擅长处理稀有词泛化提供了新见解。我们还将代码公开 avail。

关键词

引用

@article{arxiv.2510.04268,
  title  = {LongTail-Swap: benchmarking language models' abilities on rare words},
  author = {Robin Algayres and Charles-Éric Saint-James and Mahi Luthra and Jiayi Shen and Dongyan Lin and Youssef Benchekroun and Rashel Moritz and Juan Pino and Emmanuel Dupoux},
  journal= {arXiv preprint arXiv:2510.04268},
  year   = {2025}
}