中文

TruthTorchLM:用于预测LLM输出真实性的综合性图书馆

计算与语言 2025-07-14 v1

摘要

生成式大型语言模型(LLMs)不可避免地会产生不真实的响应。准确预测这些输出的真实性在高风险场景下尤为关键。为加速该领域的研究并使真实性预测方法更易于访问,本文介绍了TruthTorchLM——一个开源、综合性的Python图书馆,特色是拥有30多种真实性预测方法,我们称之为Truth Methods。与专注于仅文档 grounding 验证的现有工具包如Guardrails,或仅限于不确定性方法的LM-Polygraph不同,TruthTorchLM提供了广泛且可扩展的技术集合。这些方法在计算成本、访问层级(如黑盒 vs 白盒)、文档 grounding 要求和监督类型(自监督或监督)等方面呈现出多样化的权衡。TruthTorchLM与HuggingFace和LiteLLM无缝兼容,支持本地托管和API-based模型。它还提供了用于生成、评估、校准和长形式真实性预测的统一接口,以及灵活的框架以便于扩展新方法。我们在三个数据集上对代表性的真实方法进行评估:TriviaQA、GSM8K和FactScore-Bio。代码已发布于 https://github.com/Ybakman/TruthTorchLM

关键词

引用

@article{arxiv.2507.08203,
  title  = {TruthTorchLM: A Comprehensive Library for Predicting Truthfulness in LLM Outputs},
  author = {Duygu Nur Yaldiz and Yavuz Faruk Bakman and Sungmin Kang and Alperen Öziş and Hayrettin Eren Yildiz and Mitash Ashish Shah and Zhiqi Huang and Anoop Kumar and Alfy Samuel and Daben Liu and Sai Praneeth Karimireddy and Salman Avestimehr},
  journal= {arXiv preprint arXiv:2507.08203},
  year   = {2025}
}