PIKA:面向后训练对齐的专家级合成数据集
计算与语言
2026-04-10 v2
摘要
高质量指令数据是 LLM 对齐的关键,但现有开源数据集往往效率不足,需要数十万个示例才能接近专有性能。本文发现,除了广为人知的提示-响应质量外,提示难度本身也在推动对齐收益发挥关键作用。基于此观察,我们引入 PiKa,一套数据高效的专家级对齐数据集,聚焦于高难度指令上的监督。PiKa-SFT 数据集仅包含 3 万个示例,仅为主流专有数据集(如 Magpie-Pro)的十分之一。尽管规模较小,但在 AlpacaEval 2.0 和 Arena-Hard 等广泛使用的基准测试上,用 PiKa-SFT 微调的 Llama-3-8B-Base 甚至可以超越在 1000 万专有示例上训练的官方 Llama-3-8B-Instruct 模型。我们还在 Qwen2.5 系列(0.5B-7B)上验证了 PiKa 的通用性, consistently 超越其官方指令调优版本。此外,我们提供 3 万组高质量偏好优化示例以进一步提升对齐效果。我们的结果表明,在显著减少数据量的前提下,仍可实现有前景的对齐效果, democratizing 资源受限研究的准入。我们的代码和数据将在 https://github.com/SJY8460/PiKa 上公开。
引用
@article{arxiv.2510.06670,
title = {PIKA: Expert-Level Synthetic Datasets for Post-Training Alignment from Scratch},
author = {Shangjian Yin and Shining Liang and Wenbiao Ding and Yuli Qian and Zhouxing Shi and Hongzhi Li and Yutao Xie},
journal= {arXiv preprint arXiv:2510.06670},
year = {2026}
}