更多 RLHF,更可信?关于偏好对齐对可信度的影响
计算与语言
2024-12-24 v2 人工智能
摘要
大型语言模型 (LLM) 的可信度指其输出在可靠性、安全性和伦理对齐方面的程度,已成为重要关注点. 实际中,基于人类偏好的强化学习 (RLHF) 被广泛用于对齐 LLM,但其对模型可信度的假设性影响尚未得到严格评估. 为填补此知识鸿沟,本研究探讨了基于通用偏好数据的 RLHF 在五个可信度维度上的表现:毒性、偏见、机器伦理、真实性和隐私. 我们的结果表明,RLHF 在人类偏好上并不自动保证可信度,常常观察到反向效果. 此外,我们提出采用高效影响函数数据归因方法适用于 RLHF 情境,以更好理解微调数据对单个可信度基准的影响,并通过提供估计的归因分数展示其可行性. 我们的结果凸显了在数据和框架层面需要更细致的对齐方法的必要性,我们希望本研究能引导社区开发出在不牺牲可信度的前提下日益强大的语言模型.
引用
@article{arxiv.2404.18870,
title = {More RLHF, More Trust? On The Impact of Preference Alignment On Trustworthiness},
author = {Aaron J. Li and Satyapriya Krishna and Himabindu Lakkaraju},
journal= {arXiv preprint arXiv:2404.18870},
year = {2024}
}