人工道德智能体的可解释性最低水平
人工智能
2023-07-04 v1 计算机与社会
摘要
随着人工智能(AI)模型的持续扩展,它们变得更具能力并集成到各类决策系统中。对于参与道德决策的模型,即所谓的人工道德智能体(AMA),可解释性提供了一种信任和理解智能体内部推理机制以用于有效使用和纠错的方式。在本文中,我们概述了这一快速发展的 AI 可解释性子领域,引入了可解释性最低水平(MLI)的概念,并为各类智能体推荐了 MLI,以助其在现实环境中的安全部署。
引用
@article{arxiv.2307.00660,
title = {Minimum Levels of Interpretability for Artificial Moral Agents},
author = {Avish Vijayaraghavan and Cosmin Badea},
journal= {arXiv preprint arXiv:2307.00660},
year = {2023}
}