中文

确保安全且高质量的输出:面向语言模型的指南库方法

计算与语言 2025-05-30 v2 人工智能

摘要

大型语言模型 (LLMs) 展现出令人瞩目的能力,但也带来了诸如偏见内容生成和隐私问题等风险。当前的对齐技术之一包括原则驱动的集成,但它面临着手工制定规则不精确以及缺乏安全训练的模型对风险感知不足的挑战。为了解决这些问题,我们引入了 Guide-Align,一种两阶段方法。首先,一个经过安全训练的模型识别潜在风险并为各种输入制定具体指南,从而建立一个全面的指南库和一个用于输入-指南检索的模型。随后,检索模型将新输入与相关指南关联,这些指南指导 LLMs 生成响应,以确保安全且高质量的输出,从而与人类价值观对齐。一个额外的可选阶段涉及使用通过第二阶段实施的流程生成的、对齐良好的数据集来微调模型。我们的方法定制指南以适应多样化的输入,从而增强了指南库的细粒度和全面性。此外,它通过轻量级检索模型结合了来自经过安全训练的 LLM 的安全专业知识。我们在三个基准上评估了我们的方法,证明了 LLM 安全性和质量的显著提升。值得注意的是,我们微调后的模型 Labrador,即使在 130 亿参数规模下,也优于 GPT-3.5-turbo,并在对齐能力上超越了 GPT-4。

关键词

引用

@article{arxiv.2403.11838,
  title  = {Ensuring Safe and High-Quality Outputs: A Guideline Library Approach for Language Models},
  author = {Yi Luo and Zhenghao Lin and Yuhao Zhang and Jiashuo Sun and Chen Lin and Chengjin Xu and Xiangdong Su and Yelong Shen and Jian Guo and Yeyun Gong},
  journal= {arXiv preprint arXiv:2403.11838},
  year   = {2025}
}

备注

Accepted to NAACL 2024 main conference