Self-Judge:基于对齐自评的指令遵循选择性方法
计算与语言
2024-09-04 v1
摘要
预训练的大语言模型(LLM)可以通过指令调优来遵循人类指令。然而,由于测试时数据分布的变化,这些模型可能不总能准确执行指令, potentially 生成事实错误或不一致的内容。为了提高LLM在遵循指令方面的可靠性,我们提出研究选择性指令遵循,即在预期响应质量较低时拒绝执行指令。我们训练评判模型以预测模型响应的质量分数。为解决数据稀缺问题,我们引入Self-J,一种无需人工标注质量分数即可开发评判模型的自训练框架。该方法利用模型固有的自评估能力从标记的指令调优数据中提取响应质量信息。它包含一个金标准参考答案以促进自评估,并通过评估响应样本与金标准参考之间的语义相似性进行校准。在训练阶段,我们采用自蒸馏作为正则化技术,以增强无参考估计的能力。为验证在通用指令遵循任务上的对齐评估,我们收集了来自 Hugging Face 的大规模高质量指令用于模型训练和评估。在五个开源模型上的大量实验表明,我们的方法与GPT-4的相关性远高于强基线,例如从GPT-4和GPT-3.5-turbo蒸馏的监督模型。我们的分析显示,该模型在不同领域具有强大的泛化能力。此外,我们的评判模型也可作为优秀的奖励模型,例如通过最佳32采样使用我们的评判模型,使 WizardLM-13B-V1.2 在 AlpacaEval v1和v2版本中分别从89.17提升到92.48,从12.03提升到15.90。
引用
@article{arxiv.2409.00935,
title = {Self-Judge: Selective Instruction Following with Alignment Self-Evaluation},
author = {Hai Ye and Hwee Tou Ng},
journal= {arXiv preprint arXiv:2409.00935},
year = {2024}
}
备注
Under review