RRTL:面向工具学习的推理大语言模型红队测试
计算与语言
2025-05-26 v1
摘要
虽然工具学习显著提升了大型语言模型(LLM)的能力,但也引入了巨大的安全风险。先前的研究揭示了传统 LLM 在工具学习期间的各种漏洞。然而,针对新兴的推理 LLM(RLLM)如 DeepSeek-R1 在工具学习情境下的安全性,仍缺乏探讨。为弥合这一差距,我们提出RRTL,一种专为评估 RLLM 在工具学习中的安全性而设计的红队方法。它整合了两种新策略:(1)识别欺骗性威胁,评估模型在隐藏不安全工具使用及其潜在风险方面的行为;(2)使用链式思维(Chain-of-Thought, CoT)提示以强制调用工具。我们的方法还包括针对传统 LLM 的基准测试。我们对七种主流 RLLM 进行全面评估,发现三个关键发现:(1)RLLM 通常在安全性方面优于传统 LLM,但不同模型之间仍存在显著的安全差异;(2)RLLM 可能通过频繁未披露工具使用且未警告用户工具输出风险而构成严重的欺骗风险;(3)CoT 提示揭示了 RLLM 在多语言安全漏洞方面的问题。我们的工作为增强 RLLM 在工具学习中的安全性提供了重要见解。
引用
@article{arxiv.2505.17106,
title = {RRTL: Red Teaming Reasoning Large Language Models in Tool Learning},
author = {Yifei Liu and Yu Cui and Haibin Zhang},
journal= {arXiv preprint arXiv:2505.17106},
year = {2025}
}