中文

语言模型仍无测谎仪:探究经验与概念障碍

计算与语言 2024-06-28 v1 机器学习

摘要

我们探讨大型语言模型(LLMs)是否具有信念,以及若有,我们如何度量它们。首先,我们评估了两种已有方法,一种来自 Azaria 和 Mitchell(2023),另一种来自 Burns 等人(2022)。我们提供的经验结果表明,这些方法在非常基础的方面无法泛化。接着我们论证,即便 LLMs 具有信念,这些方法也因概念原因不太可能成功。因此,目前仍无 LLMs 的测谎仪。在描述经验结果后,我们退一步考量是否本应预期 LLMs 首先具有类似信念的东西。我们考察了近期一些旨在表明 LLMs 不可能有信念的论证,并指出这些论证是误导性的。我们为围绕 LLMs 信念地位的问题提供了更具建设性的框架,并强调该问题的经验本性。最后,我们建议了未来工作的一些具体路径。

关键词

引用

@article{arxiv.2307.00175,
  title  = {Still No Lie Detector for Language Models: Probing Empirical and Conceptual Roadblocks},
  author = {B. A. Levinstein and Daniel A. Herrmann},
  journal= {arXiv preprint arXiv:2307.00175},
  year   = {2024}
}