量化信任:面向可信 AI 代理的金融风险管理
人工智能
2026-05-06 v2 计算工程、金融与科学
摘要
可信 AI 的 prior work 强调模型内部属性,如偏差缓解、对抗鲁棒性和可解释性。随着 AI 系统演变为部署在开放环境中并 increasingly 连接到支付或资产的自主代理,信任的运营意义正从模型内部属性转向 end-to-end 结果:whether an agent 完成任务、遵循用户意图以及避免导致物质或心理伤害的失败。这些风险本质上是 product-level 的,不能仅通过技术安全措施消除,因为 agent 行为本质上是随机的。为弥合 model-level 可靠性与 user-facing assurance 之间的差距,我们提出了一个基于风险管理的补充框架。drawing inspiration from financial underwriting,我们引入了 Agentic Risk Standard(ARS),一种用于 AI 中介交易的支付结算标准。ARS 将风险评估、underwriting 和 compensation 集成到单个交易框架中,在与 agent 交互时保护用户。ARS 下,用户在执行失败、意图错位或意外结果的情况下可获得预定义且具有法律约束力的 compensation。这将信任从对模型行为的隐式期望转向一个明确的、可衡量的、可执行的 product guarantee。我们还呈现了一个分析 ARS 应用于 agentic transactions 社会效益的模拟研究。ARS 的实现可在 https://github.com/t54-labs/AgenticRiskStandard 查找。
引用
@article{arxiv.2604.03976,
title = {Quantifying Trust: Financial Risk Management for Trustworthy AI Agents},
author = {Wenyue Hua and Tianyi Peng and Chi Wang and Jiaxin Pei and Ian Kaufman and Bryan Lim and Chandler Fang},
journal= {arXiv preprint arXiv:2604.03976},
year = {2026}
}
备注
30 pages, 9 figures