中文

小型语言模型作为守护者:开创人工智能安全新途径

计算与语言 2025-01-24 v1 人工智能

摘要

以往大型语言模型(LLM)的安全研究大多集中在增强LLM的对齐性,以更好地适应人类的安全要求。然而,将这种安全特性内化到更大的模型中会带来训练成本增加和有用性意外下降的挑战。为克服这些挑战,采用模块化方法,使用较小的LLM检测有害用户查询,被认为是设计具有安全要求的基于LLM的系统的便捷解决方案。在本文中,我们利用较小的LLM进行有害查询检测和安全响应生成。我们介绍了我们的安全要求和有害性分类法,然后提出了一种多任务学习机制,将两个任务融合到单个模型中。我们展示了我们方法的有效性,在有害查询检测和安全响应性能方面与公开可用的LLM相比,达到或超越了它们。

关键词

引用

@article{arxiv.2405.19795,
  title  = {SLM as Guardian: Pioneering AI Safety with Small Language Models},
  author = {Ohjoon Kwon and Donghyeon Jeon and Nayoung Choi and Gyu-Hwung Cho and Changbong Kim and Hyunwoo Lee and Inho Kang and Sun Kim and Taiwoo Park},
  journal= {arXiv preprint arXiv:2405.19795},
  year   = {2025}
}