中文

LM-Polygraph:语言模型的不确定性估计

计算与语言 2023-11-14 v1 机器学习

摘要

大语言模型(LLMs)近期能力的进步为各领域大量突破性应用铺平了道路。然而,一个重大挑战随之而来:这些模型常常“幻觉”编造事实,且未向用户提供明显的手段以辨别其陈述的真实性。不确定性估计(UE)方法是更安全、更负责任、更有效地使用 LLM 的一条路径。然而,迄今为止,关于 LLM 的 UE 方法的研究主要集中于理论贡献而非工程贡献。在本工作中,我们通过引入 LM-Polygraph 来解决这一问题,这是一个在文本生成任务中为 LLM 实现一系列最先进 UE 方法的框架,并提供统一的 Python 编程接口。此外,它引入了一个可扩展的基准,用于研究人员对 UE 技术进行一致评估,以及一个演示 Web 应用,该应用以置信度分数丰富标准聊天对话,使最终用户能够辨别不可靠的回复。LM-Polygraph 兼容最新的 LLM,包括 BLOOMz、LLaMA-2、ChatGPT 和 GPT-4,并设计用于支持未来发布的类似风格的语言模型。

关键词

引用

@article{arxiv.2311.07383,
  title  = {LM-Polygraph: Uncertainty Estimation for Language Models},
  author = {Ekaterina Fadeeva and Roman Vashurin and Akim Tsvigun and Artem Vazhentsev and Sergey Petrakov and Kirill Fedyanin and Daniil Vasilev and Elizaveta Goncharova and Alexander Panchenko and Maxim Panov and Timothy Baldwin and Artem Shelmanov},
  journal= {arXiv preprint arXiv:2311.07383},
  year   = {2023}
}

备注

Accepted at EMNLP-2023