中文

面向金融服务的 LLM 自动红队测试中的风险调整有害评分

计算金融 2026-03-12 v1 人工智能 计算机与社会

摘要

大型语言模型 (LLM) 在金融服务领域的快速采用带来了新的运营、监管和安全风险。然而大多数红队测试基准仍然是领域中立的,无法捕捉受监管的金融服务、保险和银行 (BFSI) 环境中特定失效模式。此类失效模式可以通过合法或专业上合理的表述来诱发。我们提出了一个针对金融服务中 LLM 安全失效的风险感知评估框架,结合金融有害行为的领域特定分类法、自动化的多轮红队测试管道以及集成式评判协议。我们引入了风险调整有害评分 (RAHS),这是一种风险敏感的指标,超越成功率,通过量化披露的运营严重程度,考虑缓解信号,并利用评判者间的一致性。我们发现,更高的解码随机性和持续的自适应互动不仅增加违禁成功率,还导致系统性地向更严重且具有操作可寻性的金融披露进行升级。这些结果暴露了单轮、领域中立安全评估的局限性,并动机了在面向实际 BFSI 部署的风险敏感评估下,针对持续对抗压力进行风险敏感性评估。

关键词

引用

@article{arxiv.2603.10807,
  title  = {Risk-Adjusted Harm Scoring for Automated Red Teaming for LLMs in Financial Services},
  author = {Fabrizio Dimino and Bhaskarjit Sarmah and Stefano Pasquali},
  journal= {arXiv preprint arXiv:2603.10807},
  year   = {2026}
}