LLM Factoscope: 通过内部状态分析揭示LLM的事实辨别能力
计算与语言
2024-07-19 v3 人工智能
摘要
大型语言模型(LLM)凭借广泛的知识和创造能力革新了各个领域。然而,LLM的一个关键问题是其倾向于产生偏离事实现实的输出。这一现象在医疗咨询和法律建议等对准确性要求极高的敏感应用中尤为令人担忧。在本文中,我们引入了LLM factoscope,一种基于孪生网络的新型模型,利用LLM的内部状态进行事实检测。我们的研究揭示了LLM在生成事实与非事实内容时内部状态的可区分模式。我们展示了LLM factoscope在各种架构上的有效性,在事实检测中实现了超过96%的准确率。我们的工作为利用LLM内部状态进行事实检测开辟了新途径,并鼓励进一步探索LLM内部工作机制以增强可靠性和透明度。
引用
@article{arxiv.2312.16374,
title = {LLM Factoscope: Uncovering LLMs' Factual Discernment through Inner States Analysis},
author = {Jinwen He and Yujia Gong and Kai Chen and Zijin Lin and Chengan Wei and Yue Zhao},
journal= {arXiv preprint arXiv:2312.16374},
year = {2024}
}