随机系统中的可信赖性:迈向打开黑盒
计算机与社会
2025-01-29 v1
摘要
AI 系统越来越多地被委以在监督日益减少的情况下完成任务。这种委托要求用户接受某些风险,通常通过人类与 AI 之间感知或实际的价值对齐来缓解,从而产生系统将按预期行事的信心。然而,AI 系统的随机行为威胁到破坏这种对齐和潜在信任。在这项工作中,我们从哲学视角探讨随机性与可信赖性之间的张力和潜在冲突。我们展示了随机性如何使建立信任的传统方法复杂化,并评估了两种现有的管理方法:(1) 消除面向用户的随机性以创造确定性体验,以及 (2) 允许用户独立控制随机性的容差。我们认为这两种方法都不充分,因为并非所有形式的随机性都以相同方式或相同程度影响可信赖性。相反,我们引入了随机性的新定义,并提出了针对 AI 系统和用户的潜在价值建模,以更好地评估对齐。这项工作为理解随机性如何以及何时影响可信赖性奠定了基础,使得在复杂 AI 系统中能够进行更精确的信任校准,并强调了社会技术分析对于有效应对这些挑战的重要性。
引用
@article{arxiv.2501.16461,
title = {Trustworthiness in Stochastic Systems: Towards Opening the Black Box},
author = {Jennifer Chien and David Danks},
journal= {arXiv preprint arXiv:2501.16461},
year = {2025}
}
备注
22 pages, 2 figures