人机交互中可解释性度量的统一贝叶斯表述
人工智能
2021-04-23 v1
摘要
现有生成人类感知智能体行为的方法将不同的可解释性度量孤立地加以考虑。此外,这些度量在不同假设下被研究,从而排除了在同一假设下捕捉这些度量的单一框架的设计可能。本文中,我们提出一个统一的贝叶斯框架,该框架对人类观察者关于智能体不断演化的信念进行建模,并由此定义广义人类感知规划问题。我们将表明,先前文献中可解释性度量(如可说明性、可读性与可预测性)的定义作为我们通用框架的特例自然导出。通过该框架,我们还揭示了一个此前被忽视的事实:人机交互实质上是开放世界问题,特别是由于对智能体的人类信念进行建模所导致。因为人类不仅可能持有智能体未知的信念,还可能在面对新颖或意外行为时形成关于智能体的新假设。
引用
@article{arxiv.2104.10743,
title = {A Unifying Bayesian Formulation of Measures of Interpretability in Human-AI},
author = {Sarath Sreedharan and Anagha Kulkarni and David E. Smith and Subbarao Kambhampati},
journal= {arXiv preprint arXiv:2104.10743},
year = {2021}
}
备注
arXiv admin note: substantial text overlap with arXiv:2011.10920