中文

我、我自己与AI:用于衡量LLMs情境意识的数据集(SAD)

计算与语言 2024-07-08 v1 人工智能 机器学习

摘要

AI助手如ChatGPT被训练成通过回答“我是一个大型语言模型”来响应用户。这引发了问题:这些模型是否了解自己是大型语言模型,并且可靠地基于这一知识行动?它们是否了解当前情境,例如被部署到公共场所?我们将模型对自身及其情境的认知称为情境意识。为量化大型语言模型的情境意识,本文引入了一系列基于问答和指令遵循的行为测试。这些测试构成了 Situational Awareness Dataset(SAD)基准,包含7个任务类别和超过13,000个问题。该基准测试了诸多能力,包括大型语言模型(i)识别其自生成文本的能力,(ii)预测其自身行为的能力,(iii)确定提示是来自内部评估还是真实世界部署的能力,以及(iv)依赖自身知识的指令遵循能力。我们在SAD上评估了16个大型语言模型,包括基础模型(预训练模型)和聊天模型。尽管所有模型的表现都优于随机,但最高得分的模型(Claude 3 Opus)在某些任务上仍远不及人类基准。我们还观察到,SAD的表现仅部分由一般知识指标(例如MMLU)所预测。聊天模型——经过微调用作AI助手的模型——在SAD上的表现优于其对应的基础模型,但在一般知识任务上并非如此。SAD的目的是通过将情境意识分解为量化能力,促进对大型语言模型情境意识的科学理解。情境意识重要,因为它增强了模型进行自主规划和行动的能力。虽然这可能为自动化带来潜在益处,但也引入了与AI安全和控制相关的新风险。代码和最新结果可访问 https://situational-awareness-dataset.org。

关键词

引用

@article{arxiv.2407.04694,
  title  = {Me, Myself, and AI: The Situational Awareness Dataset (SAD) for LLMs},
  author = {Rudolf Laine and Bilal Chughtai and Jan Betley and Kaivalya Hariharan and Jeremy Scheurer and Mikita Balesni and Marius Hobbhahn and Alexander Meinke and Owain Evans},
  journal= {arXiv preprint arXiv:2407.04694},
  year   = {2024}
}

备注

11 page main body, 98 page appendix, 58 figures