中文

语言模型词汇关键表示空间中的相关性与导航

计算与语言 2024-10-04 v1

摘要

语言模型(LM)解码基于下一个标记预测(NTP)概率分布。对于神经网络 LM(例如基于 Transformer 的模型),NTP 分布本质上是编码输入上下文(查询)与固定词汇表示(键)之间进行 softmax 正则化点积的结果。本文我们研究了关键分布对 NTP 分布的影响,具体关注键之间的相似性是否会触发 NTP 中的虚假相关性。通过知识探针任务,我们显示在 NTP 分布中,前几名的标记通常是准确的。然而,中等排名的预测高度偏向于与这些顶部标记在分布上(不一定是语义上)相似的标记。例如,如果“P”被预测为 top-1 标记,则不管它们是否导致正确的解码结果,“A”至“Z”的所有标记都可能在 NTP 中排名靠前。这会损害采样多样性,使正确的长尾结果的采样变得无望且嘈杂。我们通过一种新颖的基于上下文的方法来缓解此问题,该方法不断将查询表示推远离已探索的区域。具体做法是将已探索的解码结果包含在上下文中,并提示 LM 生成其他内容,这鼓励 LM 生成与已探索的键具有小点积的查询表示。实验在知识探针任务上显示,我们的方法导致了高效地导航远离已探索的键以到达正确新键。我们进一步将该方法扩展到开放式和链式思维(用于推理)生成。实验结果表明,ICN 有助于更好的生成多样性和改进的自我一致性投票性能。最后,我们讨论了固定键空间造成的潜在训练问题,以及未来研究中的挑战和可能的解决方法。

关键词

引用

@article{arxiv.2410.02284,
  title  = {Correlation and Navigation in the Vocabulary Key Representation Space of Language Models},
  author = {Letian Peng and Chenyang An and Jingbo Shang},
  journal= {arXiv preprint arXiv:2410.02284},
  year   = {2024}
}