中文

利用局部本征维数表征大语言模型生成内容的真实性

计算与语言 2024-02-29 v1

摘要

我们研究如何表征和预测由大语言模型(LLMs)生成的文本的真实性,这是建立人类与 LLMs 之间信任的关键步骤。尽管已提出几种基于熵或言语化不确定性的方法来校准模型预测,但这些方法往往难以处理、对超参数敏感,且在应用于 LLMs 的生成任务时可靠性较低。在本文中,我们建议通过研究内部激活并利用模型激活的局部本征维数(LID)来量化 LLM 的真实性。通过在四个问答(QA)数据集上的实验,我们证明了所提方法的有效性。此外,我们研究了 LLMs 中的本征维数及其与模型层、自回归语言建模和 LLM 训练的关系,揭示了本征维数可以是理解 LLMs 的有力方法。

关键词

引用

@article{arxiv.2402.18048,
  title  = {Characterizing Truthfulness in Large Language Model Generations with Local Intrinsic Dimension},
  author = {Fan Yin and Jayanth Srinivasa and Kai-Wei Chang},
  journal= {arXiv preprint arXiv:2402.18048},
  year   = {2024}
}

备注

preprint, 9 pages, 5 figures