通过动态安全包络对不安全系统进行监督
人工智能
2018-11-26 v1
摘要
本文回顾了人在回路(Human-in-the-Loop)既对防范机器学习中广泛理解的失败模式至关重要、又非实际解决方案的原因。随后,我们回顾了两种应对此问题的当前启发式方法。其一是可证明安全包络,仅当系统动力学完全已知时才可能实现,但在最优行为基于具有难以理解安全特性的机器学习时,可作为有用的安全保证。其二是更简单的断路器模型,它可在无任何特定系统模型的情况下通过停止系统来阻止或预防灾难性后果。本文提出使用启发式动态安全包络,其作为这些方法之间合理的折中方案,可在避免人在回路系统所面临某些更困难问题的同时实现人类监督。最后,本文总结了该方法如何用于部署了否则不安全系统的治理。
引用
@article{arxiv.1811.09246,
title = {Oversight of Unsafe Systems via Dynamic Safety Envelopes},
author = {David Manheim},
journal= {arXiv preprint arXiv:1811.09246},
year = {2018}
}