调制干预偏好优化(MIPO):保留易项,优化难项
计算与语言
2024-09-30 v2 人工智能
机器学习
摘要
偏好优化方法通常以已训练良好的SFT模型为参考模型。在RLHF和DPO中,使用正则化项来防止策略模型在偏好优化过程中偏离参考模型的分布,从而避免生成异常响应。当参考模型已经与给定数据高度对齐或仅需轻微调整时,这种方法可以产生一个已对齐的模型。然而,如果参考模型与给定数据不对齐且需要显著偏离其当前状态,正则化项实际上可能阻碍模型对齐。在本研究中,我们提出了**调制干预偏好优化(MIPO)**来解决此问题。MIPO根据给定数据与参考模型的对齐程度来调节来自参考模型的干预程度。如果数据与参考模型对齐良好,则增加干预以防止策略模型显著偏离参考模型。相反,如果对齐度较差,则减少干预以促进更广泛的训练。我们使用Mistral-7B和Llama3-8B对比MIPO和DPO的性能,分别在Alpaca Eval 2.0和MT-Bench上进行测试。实验结果表明,在各种评估场景下,MIPO均一致优于DPO。
引用
@article{arxiv.2409.17545,
title = {Modulated Intervention Preference Optimization (MIPO): Keep the Easy, Refine the Difficult},
author = {Cheolhun Jang},
journal= {arXiv preprint arXiv:2409.17545},
year = {2024}
}
备注
8pages, submitted to AAAI 2025