中文

安全可靠:为指令调优模型实现安全性与有用性

计算与语言 2024-12-03 v1

摘要

大型语言模型(LLM)在复杂推理和文本生成方面已展现出惊人的能力。然而,这些模型在针对问题性输入进行提示时,可能会无意中生成不安全或偏见性的响应,这引发了对于实际部署的重大伦理和实际关切。本研究 addresses the critical challenge of developing language models that generate both helpful and harmless content, navigating the delicate balance between model performance and safety. 我们展示了在预训练模型的指令调优过程中 incorporating safety-related instructions 能显著降低针对不安全提示的有毒响应,而不会牺牲在有用性数据集上的性能。我们发现直接偏好优化(DPO)尤其有效,通过利用 chosen and rejected responses for learning,超越了SIT和RAFT。我们的 approach 将安全响应比例从40%提升至90%以上,涵盖多种有害性基准测试。此外,我们讨论了一个严格的评估框架,包括 specialized metrics and diverse datasets for safety and helpfulness tasks,确保对模型能力的全面评估。

关键词

引用

@article{arxiv.2412.00074,
  title  = {Safe to Serve: Aligning Instruction-Tuned Models for Safety and Helpfulness},
  author = {Avinash Amballa and Durga Sandeep Saluru and Gayathri Akkinapalli and Abhishek Sureddy and Akshay Kumar Sureddy},
  journal= {arXiv preprint arXiv:2412.00074},
  year   = {2024}
}

备注

18 pages