STAR-1:针对大型推理模型的更安全对齐——1K规模数据
计算与语言
2025-11-12 v2 人工智能
摘要
本文介绍了STAR-1,这是一个专为大型推理模型(LRMs)如DeepSeek-R1设计的高质量、仅需1K规模的安全数据集。STAR-1基于三个核心原则——多样性、深思熟虑的推理和严格的筛选——旨在满足LRMs安全对齐的关键需求。具体而言,我们首先整合来自多样来源的现有开源安全数据集。随后,我们策划安全政策以生成政策导向的深思熟虑推理样本。最后,我们应用基于GPT-4o的安全评分系统来选择符合最佳实践的训练示例。实验结果表明,使用STAR-1对LRMs进行微调,可在四个基准测试中实现约40%的安全性能提升,同时仅在五个推理任务中产生约1.1%的推理能力轻微下降。广泛的消融研究进一步验证了我们构建STAR-1的设计原则的重要性,并分析了其在LRMs和传统LLMs中的疗效。我们的项目页面为https://ucsc-vlaa.github.io/STAR-1。
引用
@article{arxiv.2504.01903,
title = {STAR-1: Safer Alignment of Reasoning LLMs with 1K Data},
author = {Zijun Wang and Haoqin Tu and Yuhan Wang and Juncheng Wu and Yanqing Liu and Jieru Mei and Brian R. Bartoldson and Bhavya Kailkhura and Cihang Xie},
journal= {arXiv preprint arXiv:2504.01903},
year = {2025}
}