面向可靠性感知对齐的弱到强泛化提升
计算与语言
2024-06-28 v1
摘要
大型语言模型(LLM)正在迅速发展,已超过人类在许多自然语言任务上的能力。然而,对齐这些超人类 LLM 与人类知识仍具有挑战性,因为人类标注员提供的监督信号可能存在错误。这一问题被称为“超对齐”问题,需要增强弱到强的泛化能力,即强 LLM必须从弱源提供的不完美监督中进行泛化。为解决此问题,我们提出了一种通过考虑弱监督信号可靠性来提高弱到强泛化的方法。在我们的方法中,我们查询弱监督者获取多个答案,估计答案的可靠性,并通过过滤不确定的数据或对可靠数据进行重新加权来增强对齐过程。在四个数据集上的实验表明,我们的方法有效地识别了弱标签的质量,并显著提升了弱到强的泛化能力。我们的工作提出了有效的鲁棒模型对齐技术,减少了来自噪声监督的误差传播,提高了 LLM 的准确性和可靠性。代码已公开于 http://github.com/Irenehere/ReliableAlignment。
引用
@article{arxiv.2406.19032,
title = {Improving Weak-to-Strong Generalization with Reliability-Aware Alignment},
author = {Yue Guo and Yi Yang},
journal= {arXiv preprint arXiv:2406.19032},
year = {2024}
}