中文

期望对齐:在期望不匹配情况下处理奖励错误指定

人工智能 2024-11-01 v2 机器学习

摘要

检测和处理错误指定的目标(如奖励函数)已被广泛认为是人工智能安全研究领域的核心挑战之一。然而,即使认识到这一问题的重要性,我们尚未发现任何工作试图明确定义什么是(a)错误指定的目标以及(b)成功解决此类错误指定。在本工作中,我们以心智理论(即人类用户对AI智能体的信念)为基础,开发了一个称为期望对齐(EAL)的形式化解释框架,以理解目标错误指定及其原因。我们的EAL框架不仅作为现有工作的解释框架,还为我们提供了关于现有方法处理奖励错误指定局限性的具体见解以及新的解决策略。我们利用这些见解提出了一种新的交互式算法,该算法使用指定的奖励来推断用户对系统行为的潜在期望。我们展示了如何通过将推理问题映射为线性规划来高效实现该算法。我们在标准马尔可夫决策过程(MDP)基准上评估了我们的方法。

关键词

引用

@article{arxiv.2404.08791,
  title  = {Expectation Alignment: Handling Reward Misspecification in the Presence of Expectation Mismatch},
  author = {Malek Mechergui and Sarath Sreedharan},
  journal= {arXiv preprint arXiv:2404.08791},
  year   = {2024}
}