最近邻语言模型中的长尾危机
计算与语言
2025-03-31 v1
摘要
-最近邻语言模型 (NN-LM) 是一种检索增强型语言模型,通过在推理时直接访问由任意文本数据构建的大型数据存储来降低给定文本的困惑度。NN-LM 成功的广泛假设是,其显式记忆(即数据存储)会提升对长尾现象的预测能力。然而,先前的研究主要展示了其在检索长尾上下文方面的能力,却未深入探讨其在推理时估计长尾目标 token 概率方面的表现。本文我们检验 NN-LM 在低频 token 上的行为,考察其预测概率、检索准确率、数据存储中的 token 分布以及乘积量化的近似误差。我们的实验结果表明,NN-LM 并未提升对低频 token 的预测性能,主要受益于高频 token, regardless of 数据存储中的长尾上下文。
引用
@article{arxiv.2503.22426,
title = {Long-Tail Crisis in Nearest Neighbor Language Models},
author = {Yuto Nishida and Makoto Morishita and Hiroyuki Deguchi and Hidetaka Kamigaito and Taro Watanabe},
journal= {arXiv preprint arXiv:2503.22426},
year = {2025}
}
备注
Accepted to NAACL 2025 Findings