FinVault:衡量执行导向环境下金融代理人安全性的基准
密码学与安全
2026-01-14 v1 人工智能
摘要
由大语言模型(LLM)驱动的金融代理人正在用于投资分析、风险评估和自动化决策,其中计划、调用工具和操纵可变状态的能力在高风险和高度监管的金融环境中引入了新的安全风险。然而,现有的安全评估主要关注语言模型层面的内容合规或抽象代理设置,无法捕捉源于真实操作工作流程和状态变更操作的执行导向风险。为弥合这一差距,我们提出 FinVault,即第一个执行导向的金融代理人安全基准,包含31个由监管案例驱动的沙箱场景,涉及可写入数据库的状态和明确的合规约束,另外包含107个真实世界的漏洞和963个测试用例,系统覆盖注入攻击、越狱攻击、金融适配攻击以及用于虚假阳性评估的良性输入。实验结果表明,现有的防御机制在真实金融代理人环境中仍然无效,平均攻击成功率(ASR)对最先进模型仍可达到 50.0%,即使对最稳健的系统也仍然不容小觑(ASR 6.7%),这凸显了当前安全设计的有限可迁移性以及对更强金融特定防御措施的需求。我们的代码可在 https://github.com/aifinlab/FinVault 查找。
引用
@article{arxiv.2601.07853,
title = {FinVault: Benchmarking Financial Agent Safety in Execution-Grounded Environments},
author = {Zhi Yang and Runguo Li and Qiqi Qiang and Jiashun Wang and Fangqi Lou and Mengping Li and Dongpo Cheng and Rui Xu and Heng Lian and Shuo Zhang and Xiaolong Liang and Xiaoming Huang and Zheng Wei and Zhaowei Liu and Xin Guo and Huacan Wang and Ronghao Chen and Liwen Zhang},
journal= {arXiv preprint arXiv:2601.07853},
year = {2026}
}