面向安全可负责任 AI 代理:透明性、问责与可信赖三支柱模型
计算机与社会
2026-01-13 v1 人工智能
摘要
本文提出了一个以透明性、问责和可信赖为支柱的框架,用于开发和运行安全可靠的 AI 代理。该框架建立在人机交互系统、强化学习和协作 AI 领域的旼作基础上,定义了一条发展 towards autonomous agents 的路径,这种路径在增加自动化程度的同时保持适当的人类监督。该文认为,安全的代理自主性必须通过渐进式验证来实现,类似于自动驾驶的分阶段发展,而非通过即时完全自动化。识别了透明性和问责作为建立用户信任以及缓解生成式 AI 系统中已知风险(包括幻觉、数据偏见和目标不一致,如反转问题)的基础要求。该文进一步描述了支持该框架的三个持续工作流程:由斯坦福 Deliberative Democracy Lab 进行的 AI 代理公众 deliberation 、跨行业合作的 Safe AI Agent Consortium 以及面向三支柱模型的代理操作环境开发的开源工具。通过这些贡献,本文提供了概念清晰度和实用指导,使 AI 代理能够以透明方式运行,保持与人类价值观的一致性,并维持社会信任。
引用
@article{arxiv.2601.06223,
title = {Toward Safe and Responsible AI Agents: A Three-Pillar Model for Transparency, Accountability, and Trustworthiness},
author = {Edward C. Cheng and Jeshua Cheng and Alice Siu},
journal= {arXiv preprint arXiv:2601.06223},
year = {2026}
}
备注
15 pages, 8 figures, conference paper