Safe-Embed:揭示句子编码器的安全关键知识
计算与语言
2024-07-10 v1
摘要
尽管大型语言模型(LLM)在各类任务中展现出惊人的能力,但其对不安全提示的脆弱性仍是一个关键问题。这些不安全提示可能导致 LLM 生成涉及非法或敏感话题的回应,严重威胁其安全伦理使用。现有方法尝试使用分类模型来解决此问题,但存在若干缺陷。随着不安全提示的复杂度不断提升,基于相似性搜索的技术,这些技术识别不安全提示的特定特征,为解决这一演化问题提供了更稳健且更有效的解决方案。本文探讨了句子编码器区分安全与不安全提示的潜力,以及根据安全分类学对各类不安全提示进行分类的能力。我们引入了新的成对数据集和分类纯度(Categorical Purity, CP)指标来衡量此能力。我们的发现揭示了现有句子编码器的有效性与局限性,并提出了改进句子编码器以充当更稳健安全检测器的方向。我们的代码已公开于 https://github.com/JwdanielJung/Safe-Embed。
引用
@article{arxiv.2407.06851,
title = {Safe-Embed: Unveiling the Safety-Critical Knowledge of Sentence Encoders},
author = {Jinseok Kim and Jaewon Jung and Sangyeop Kim and Sohyung Park and Sungzoon Cho},
journal= {arXiv preprint arXiv:2407.06851},
year = {2024}
}
备注
ACL 2024 KnowledgeableLMs workshop paper