中文

无法或不应该?对 IFT/RLHF 数据集中拒绝组合的自动分析及黑箱 LLM 拒绝行为

人工智能 2024-12-24 v1 计算与语言

摘要

拒绝行为——大型语言模型 (LLM) 声明或未能完全执行用户指令的实例——对于 AI 安全和 AI 能力至关重要,尤其是有助于减少幻觉现象。这些行为在后训练期间学习,特别是在指令微调 (IFT) 和强化学习从人类反馈 (RLHF) 中。然而,现有的拒绝分类和评估数据集不充分,常仅关注应不相关 (should-not-related) 类别,而缺乏针对黑箱 LLM 输出中拒绝内容的审计工具。我们提出了完整的框架,用于分类 LLM 拒绝行为:(a) 16 类拒绝类别的分类学;(b) 来自公开 IFT 和 RLHF 数据集的超过 8600 条实例的人工标注数据集;(c) 每类拒绝类别各 8000 条的合成数据集;(d) 为拒绝分类训练的分类器。我们的工作实现了对黑箱 LLM 拒绝行为的精确审计,以及对大规模 IFT 和 RLHF 数据集中拒绝模式的自动分析。这有助于战略性地调整 LLM 的拒绝行为,促进更安全更可靠的 LLM 开发。

关键词

引用

@article{arxiv.2412.16974,
  title  = {Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs},
  author = {Alexander von Recum and Christoph Schnabl and Gabor Hollbeck and Silas Alberti and Philip Blinde and Marvin von Hagen},
  journal= {arXiv preprint arXiv:2412.16974},
  year   = {2024}
}

备注

NeurIPS 2024 Workshop SFLLM