论人机交互的形式化:计算归约、失效模式与法律-道德责任
计算机与社会
2025-09-29 v2 人工智能
人机交互
历史与综述
摘要
我们运用可计算性理论中的 oracle 机器与归约概念,对人机交互(Human-in-the-loop, HITL)AI 系统的不同设置进行形式化建模,区分了平凡的人类监控(即总函数)、单一终点人类行动(即 many-one 归约)以及高度参与的人机互动(即 Turing 归约)。随后,我们展示了不同设置在法律地位与安全性方面的显著差异。我们提出了 HITL 失效模式的分类框架,突出了 HITL 设置的实际局限性。我们进一步指出,英国和欧盟法律框架中存在的漏洞,这些法律框架聚焦于可能无法始终实现所需伦理、法律和社会技术性结果的 HITL 设置。我们建议法律应认识到不同 HITL 设置的有效性,并在这些情境下正确分配责任,避免对人类进行“替罪羊”。我们的工作表明,法律责任归属与技术可解释性之间不可调和的权衡。总体而言,我们展示了 HITL 设置涉及众多技术设计决策,且可能因人类控制之外的因素而产生失效。我们的形式化建模与分类框架为分析 HITL 设置的挑战开辟了新的视角,帮助 AI 开发者与立法者在设计 HITL 设置以更好实现预期目标方面提供指导。
引用
@article{arxiv.2505.10426,
title = {Formalising Human-in-the-Loop: Computational Reductions, Failure Modes, and Legal-Moral Responsibility},
author = {Maurice Chiodo and Dennis Müller and Paul Siewert and Jean-Luc Wetherall and Zoya Yasmine and John Burden},
journal= {arXiv preprint arXiv:2505.10426},
year = {2025}
}
备注
31 pages. Keywords: Human-in-the-loop, Automated decision making system, Human oversight in sociotechnical systems, Oracle machine, AI safety, Trustworthy AI