通过专家模型集成提高 LLM 输出以抵御越狱攻击
密码学与安全
2025-08-12 v3 人工智能
摘要
在生产环境中使用 LLM 存在安全挑战,包括对越狱和提示注入的脆弱性,这些脆弱性可能导致对人类或企业产生有害输出。当在特定领域工作时,这一挑战被放大,因为该领域通常接受 LLM 解决的主题可能与该领域无关。可以通过采用针对特定领域和安全性的数据进行微调来缓解这些问题,但仅凭这些措施仍不够,因为越狱技术不断演变。此外,API 访问的模型无法提供针对行业特定目标定制行为所需的灵活性,情境学习有时也不够充分或可靠。针对这些挑战,我们引入了 Archias——一种擅长区分域内和域外通信的专家模型。Archias 将用户查询分类为多个类别:域内查询(具体针对汽车行业)、恶意问题、价格注入、提示注入和域外示例。我们的 methodology 将专家模型(Archias)的输出整合到提示中,然后由 LLM 处理以生成响应。该方法提高了模型理解用户意图并给出恰当答案的能力。由于 Archias 体积小,可以调整、微调和用于各种目的,因此可以轻松定制到任何行业的需求。为验证我们的 approach,我们创建了一个针对汽车行业的基准数据集。此外,出于推动研究和开发的目的,我们将 our 基准数据集发布给社区。
引用
@article{arxiv.2505.17066,
title = {Improving LLM Outputs Against Jailbreak Attacks with Expert Model Integration},
author = {Tatia Tsmindashvili and Ana Kolkhidashvili and Dachi Kurtskhalia and Nino Maghlakelidze and Elene Mekvabishvili and Guram Dentoshvili and Orkhan Shamilov and Zaal Gachechiladze and Steven Saporta and David Dachi Choladze},
journal= {arXiv preprint arXiv:2505.17066},
year = {2025}
}