中文

通过保形风险控制对齐模型属性

机器学习 2024-11-06 v2 机器学习

摘要

由于训练数据中的无意偏差以及未充分指定的机器学习流程,AI 模型对齐至关重要,因为具有出色测试指标的模型可能无法满足最终用户需求。虽然通过人类反馈进行训练后对齐显示出前景,但这些方法通常局限于生成式 AI 设置,其中人类可以解释模型输出并提供反馈。在具有数值或分类输出的传统非生成式设置中,通过单样本输出检测未对齐仍然具有挑战性,而在训练期间强制执行对齐需要重复昂贵的训练过程。本文考虑了一种替代策略。我们建议通过属性测试来解释模型对齐,将对齐模型 ff 定义为属于函数子集 P\mathcal{P} 的模型,该子集表现出特定的期望行为。我们专注于使用保形风险控制对预训练模型 ff 进行后处理,以更好地与 P\mathcal{P} 对齐。具体地,我们开发了一个通用程序,用于将测试给定属性 P\mathcal{P} 的查询转换为适用于保形风险控制算法的一组损失函数。我们证明了概率保证,即 ff 周围的保形区间包含一个近似满足 P\mathcal{P} 的函数。我们在一个监督学习数据集集合上展示了我们方法的应用,这些数据集针对(形状约束的)属性,如单调性和凹性。该通用程序灵活,可应用于广泛期望的属性。最后,我们证明,只要训练数据包含即使是微小的偏差,预训练模型将始终需要对齐技术,即使模型大小或训练数据增加。

关键词

引用

@article{arxiv.2406.18777,
  title  = {Aligning Model Properties via Conformal Risk Control},
  author = {William Overman and Jacqueline Jil Vallon and Mohsen Bayati},
  journal= {arXiv preprint arXiv:2406.18777},
  year   = {2024}
}