泛化信任:语言模型中的弱到强可信性
机器学习
2025-01-03 v1 人工智能
摘要
生成式人工智能,尤其是大语言模型的迅速普及,使其被集成到各种应用中。一种被称为弱到强泛化的关键现象——即在弱模型输出上训练的强模型在任务表现上超越弱模型——已引起广泛关注。然而,诸如鲁棒性、公平性和隐私等关键的可信性属性能否以类似方式泛化,仍是一个悬而未决的问题。在本文中,我们通过考察一个更强的模型在弱模型输出上进行微调时能否继承可信性属性(我们称之为弱到强可信性泛化)来研究这一问题。为此,我们提出了两种基础性的训练策略:1) 弱可信性微调(Weak TFT),它在弱模型微调过程中利用可信性正则化;2) 弱与弱到强可信性微调(Weak+WTS TFT),它将正则化扩展到弱模型与强模型。在真实世界数据集上的实验评估表明:虽然公平性、对抗鲁棒性和 OOD 鲁棒性等部分可信性属性在两个模型均被正则化时在迁移中表现出显著提升,但隐私等其他属性并未显示出弱到强可信性的迹象。作为首个通过弱到强泛化来探索可信性泛化的研究,我们的工作为弱到强泛化的潜力与局限提供了有价值的见解。
引用
@article{arxiv.2501.00418,
title = {Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models},
author = {Martin Pawelczyk and Lillian Sun and Zhenting Qi and Aounon Kumar and Himabindu Lakkaraju},
journal= {arXiv preprint arXiv:2501.00418},
year = {2025}
}
备注
The first two authors contributed equally