中文

智能体行动的理由:意图与工具性目标

人工智能 2024-02-16 v2

摘要

意图是人工智能中一个重要且具有挑战性的概念。它之所以重要,是因为它构成了我们关心的许多其他概念的基础,例如能动性、操纵、法律责任和责备。然而,将意图归因于AI系统是有争议的,并且没有普遍接受的适用于AI智能体的意图理论。我们将智能体行动时的意图操作化,将其与它选择决策的理由联系起来。我们在结构因果影响模型中引入了一个意图的形式化定义,该定义基于哲学文献中关于意图的讨论,并适用于现实世界的机器学习系统。通过一系列示例和结果,我们表明我们的定义捕捉到了直觉上的意图概念,并满足了以往工作提出的理想特性。此外,我们展示了我们的定义如何与过去的概念相关联,包括实际因果关系,以及工具性目标的概念,后者是安全AI智能体文献中的一个核心思想。最后,我们演示了如何利用我们的定义从强化学习智能体和语言模型的行为中推断其意图。

关键词

引用

@article{arxiv.2402.07221,
  title  = {The Reasons that Agents Act: Intention and Instrumental Goals},
  author = {Francis Rhys Ward and Matt MacDermott and Francesco Belardinelli and Francesca Toni and Tom Everitt},
  journal= {arXiv preprint arXiv:2402.07221},
  year   = {2024}
}

备注

AAMAS24