ToolSword:揭示大语言模型在工具学习三个阶段中的安全问题
计算与语言
2024-08-19 v2 人工智能
摘要
工具学习被广泛认为是将大语言模型(LLMs)部署于现实场景的基础方法。尽管当前研究主要强调利用工具增强 LLMs,却经常忽视与其应用相关的新兴安全问题。为填补这一空白,我们提出了*ToolSword*,这是一个致力于细致调查工具学习中 LLMs 相关安全问题的综合框架。具体而言,ToolSword delineates 了工具学习中 LLMs 的六种安全场景,涵盖输入阶段的**恶意查询**和**越狱攻击**,执行阶段的**噪声误导**和**风险线索**,以及输出阶段的**有害反馈**和**错误冲突**。对 11 个开源和闭源 LLMs 进行的实验揭示了工具学习中持续存在的安全挑战,例如处理有害查询、使用风险工具以及提供有害反馈,甚至连 GPT-4 也易受这些挑战影响。此外,我们开展了进一步研究,旨在促进工具学习安全方面的研究。数据已发布于 https://github.com/Junjie-Ye/ToolSword。
引用
@article{arxiv.2402.10753,
title = {ToolSword: Unveiling Safety Issues of Large Language Models in Tool Learning Across Three Stages},
author = {Junjie Ye and Sixian Li and Guanyu Li and Caishuang Huang and Songyang Gao and Yilong Wu and Qi Zhang and Tao Gui and Xuanjing Huang},
journal= {arXiv preprint arXiv:2402.10753},
year = {2024}
}
备注
Accepted by ACL 2024 Main Conference