中文

一种识别表征错误的贝叶斯方法

人工智能 2021-03-30 v1

摘要

训练有素的 AI 系统与专家决策者可能犯下往往难以识别与理解的错误。确定这些错误的根本原因可改进未来的决策。本工作提出生成式错误模型(GEM),一种基于行为者(模拟智能体、机器人或人类)行为观测来推断表征错误的生成模型。该模型考虑两类错误来源:由表征局限——即“盲点”——导致的错误,以及非表征错误,例如由执行噪声或行为者策略中存在的系统性错误所引起的错误。区分这两类错误类型可实现对行为者策略的针对性精炼(即表征错误需感知增强,而其他错误可通过改进训练或注意力支持等方法减少)。我们给出 GEM 的贝叶斯推断算法,并在多个领域上评估其在恢复表征错误方面的效用。结果表明,我们的方法能够恢复强化学习智能体以及人类用户的盲点。

关键词

引用

@article{arxiv.2103.15171,
  title  = {A Bayesian Approach to Identifying Representational Errors},
  author = {Ramya Ramakrishnan and Vaibhav Unhelkar and Ece Kamar and Julie Shah},
  journal= {arXiv preprint arXiv:2103.15171},
  year   = {2021}
}