学习隐藏风险:金融领域大语言模型的可控多轮红队测试
计算与语言
2026-04-28 v2 人工智能
机器学习
摘要
大语言模型(Large Language Models, LLMs)在金融领域的部署日益增多,其不安全行为可能导致严重的监管风险。然而,大多数红队测试研究侧重于明显有害的内容,忽视了那些表面上看似合法却诱导产生违规监管响应的攻击。我们通过引入一种可控的黑盒多轮风险隐藏红队测试框架来填补这一空白,该框架在利用违规监管行为的同时,逐步隐藏表面层次的风险。该框架包含两个关键组件:风险隐藏攻击器,通过迭代优化生成多轮提示;风险隐藏控制器,预测轮次级风险隐藏分数以引导 RCA 的后续风格。我们还构建了一个特定领域的基准 FinRisk-Bench,包含跨越六个金融风险类别的 522 条指令。在九个广泛使用的 LLMs 上的实验表明,CoRT(RCA)实现了 93.19% 的平均攻击成功率,而 CoRT(RCA+RCC)进一步将平均 ASR 提升至 95.00%。我们的代码和 FinRisk-Bench 可在 https://github.com/gcheng128/CoRT 获取。
引用
@article{arxiv.2509.10546,
title = {Learning to Conceal Risk: Controllable Multi-turn Red Teaming for LLMs in the Financial Domain},
author = {Gang Cheng and Haibo Jin and Wenbin Zhang and Haohan Wang and Jun Zhuang},
journal= {arXiv preprint arXiv:2509.10546},
year = {2026}
}
备注
Accepted for ACL'26 (Main). TL;DR: We propose a controllable multi-turn risk-concealed red-teaming framework, CoRT, that progressively conceals surface-level risk while exploiting regulatory-violating behaviors on a proposed new benchmark, FinRisk-Bench