Phi-3 安全后训练:通过“破坏-修复”循环实现语言模型对齐
计算与语言
2024-08-26 v2 人工智能
摘要
近期语言模型训练的创新表明,可能创建出足够小且可在智能手机上运行的高性能模型。随着这些模型在越来越多的领域部署,确保它们符合人类偏好和安全考量至关重要。本报告中,我们呈现针对Phi-3系列语言模型进行安全对齐的方法。我们利用“破坏-修复”循环,进行多轮数据 curated、安全后训练、基准测试、红队攻击和漏洞识别,以覆盖单轮和多轮情景中的各种危害领域。我们的结果表明,这种方法在iterative地提高了Phi-3模型在广泛负责任AI基准测试中的性能。最后,我们包括用于测试Phi-3.5-mini和Phi-3.5-MoE安全行为的额外红队策略和评估,这些模型针对多语言能力进行了优化。
引用
@article{arxiv.2407.13833,
title = {Phi-3 Safety Post-Training: Aligning Language Models with a "Break-Fix" Cycle},
author = {Emman Haider and Daniel Perez-Becker and Thomas Portet and Piyush Madan and Amit Garg and Atabak Ashfaq and David Majercak and Wen Wen and Dongwoo Kim and Ziyi Yang and Jianwen Zhang and Hiteshi Sharma and Blake Bullwinkel and Martin Pouliot and Amanda Minnich and Shiven Chawla and Solianna Herrera and Shahed Warreth and Maggie Engler and Gary Lopez and Nina Chikanov and Raja Sekhar Rao Dheekonda and Bolor-Erdene Jagdagdorj and Roman Lutz and Richard Lundeen and Tori Westerhoff and Pete Bryan and Christian Seifert and Ram Shankar Siva Kumar and Andrew Berkley and Alex Kessler},
journal= {arXiv preprint arXiv:2407.13833},
year = {2024}
}