AI安全中的关键性概念
人机交互
2023-06-13 v2 人工智能
摘要
当AI智能体的行为未与人类价值观对齐时,可能会造成严重的危害。解决价值对齐问题的一种方法是引入一名人类操作员来监控智能体的所有行为。尽管该方案能保证最大安全性,但其效率极低,因为它要求人类操作员将全部注意力集中于智能体。本文提出一种更高效的方案,使操作员能够从事其他活动而不忽视其监控任务。在我们的方法中,AI智能体仅在执行关键行为(即潜在有害行为)时向操作员请求许可。我们引入了关于AI安全的关键行为概念,并讨论了如何构建衡量行为关键性(criticality)的模型。我们还探讨了如何利用操作员的反馈使智能体更智能。
引用
@article{arxiv.2201.04632,
title = {The Concept of Criticality in AI Safety},
author = {Yitzhak Spielberg and Amos Azaria},
journal= {arXiv preprint arXiv:2201.04632},
year = {2023}
}