中文

使用SFT和DPO改进LLM安全性与有用性:以OPT-350M为例的研究

计算与语言 2025-09-12 v1 人工智能 机器学习

摘要

本研究探讨了对齐技术、监督微调(Supervised Fine-Tuning, SFT)、直接偏好优化(Direct Preference Optimization, DPO)以及结合SFT+DPO方法对改善OPT-350M语言模型安全性和有用性的效果。我们利用Anthropic Helpful-Harmless RLHF数据集,对四个模型进行训练和评估:基础OPT350M、SFT模型、DPO模型以及采用SFT和DPO两种方法训练的模型。我们引入了三个关键评估指标:无害性率(Harmlessness Rate, HmR)、有用性率(Helpfulness Rate, HpR)以及综合对齐分数(Combined Alignment Score, CAS),全部源自奖励模型输出。结果表明,虽然SFT在DPO方面表现更好,但组合后的SFT+DPO模型在所有指标上均优于其他所有模型,表明这些技术是互补的。我们的发现也揭示了噪声数据、有限的GPU资源和训练限制所带来的挑战。这项研究提供了对微调策略如何影响模型对齐的全面视图,为未来工作中构建更稳健的对齐管道奠定了基础。

关键词

引用

@article{arxiv.2509.09055,
  title  = {Improving LLM Safety and Helpfulness using SFT and DPO: A Study on OPT-350M},
  author = {Piyush Pant},
  journal= {arXiv preprint arXiv:2509.09055},
  year   = {2025}
}

备注

17 pages, 3 figures. Code and dataset available at https://github.com/PiyushWithPant/Improving-LLM-Safety-and-Helpfulness-using-SFT-and-DPO