中文

生成式大语言模型标记概率分布中的未利用信息:通过计算期望值提高 LLM 阅读理解能力

计算与语言 2024-09-27 v2 人工智能

摘要

LLM 文本解码是衡量 LLM 质量的关键因素。我们展示了两个实验,表明通过操作标记概率可以改进解码方法。首先,我们在 SummEval 摘要评分数据集上测试多个 LLM,以衡量阅读理解能力。我们将从贪心解码得到的分数与从下个标记概率分布中计算的期望值进行比较。我们通过放大逻辑值中的温度参数来增加分数的熵,这使得 SummEval 上的表现显著提升(以与人类判断的相关性为指标)。对于 7B Mistral 模型,性能提升约为 6-8% 增至 13-28%;对于 Mixtral 模型,提升约 20%-46% 增至 37%-56%,甚至超过了 GPT-4 0314 在两个指标上的结果。部分提升似乎与位置偏差有关。其次,我们使用基于概率的树形采样算法,检查给定提示下所有最可能的生成。

关键词

引用

@article{arxiv.2406.10267,
  title  = {Unused information in token probability distribution of generative LLM: improving LLM reading comprehension through calculation of expected values},
  author = {Krystian Zawistowski},
  journal= {arXiv preprint arXiv:2406.10267},
  year   = {2024}
}

备注

7 pages, 1 figure, presented at FEDCSIS 2024 conference,