Weak-to-Strong Generalization beyond Accuracy: a Pilot Study in Safety, Toxicity, and Legal Reasoning
计算与语言
2025-03-26 v2 机器学习
摘要
随着大型语言模型(LLM)不断进步,确保其与人类价值观的一致性变得越来越关键。传统的对齐方法高度依赖人类反馈来微调模型。随着超越人类水平的模型输出可能超出人类理解,评估和对齐这些模型使用人类判断提出了重大挑战。为了应对这些挑战,最近的研究使用弱监督者来从更强大的模型中引出知识。然而,现有研究的实证设置与真正的对齐目标之间存在重要的类比关系。我们指出,现有研究在类似的设置(即二元分类)中研究弱到强的生成,而不是实际的对齐相关任务(如安全性)。在本文中,我们通过将弱到强的生成扩展到实际对齐的上下文来弥合这一差距。我们在三个复杂的对齐任务中(安全性、毒性和法律推理)实证地展示了弱到强的生成的广泛存在。此外,我们探索了提高对齐性能的高效策略,以增强模型结果的质量。最后,我们总结并分析了针对特定对齐任务的挑战和潜在解决方案,我们希望能够催化关于弱到强一般化的话题的研究进展。我们的代码已发布于 https://github.com/yeruimeng/WTS.git。
引用
@article{arxiv.2410.12621,
title = {Weak-to-Strong Generalization beyond Accuracy: a Pilot Study in Safety, Toxicity, and Legal Reasoning},
author = {Ruimeng Ye and Yang Xiao and Bo Hui},
journal= {arXiv preprint arXiv:2410.12621},
year = {2025}
}