基于互信息的自监督对齐:无需偏好标签学习遵循原则
计算与语言
2024-05-22 v2
摘要
当提示语言模型(LM)时,用户通常期望模型能在不同任务中遵循一套行为原则,例如生成有洞察力的内容同时避免有害或偏见的语言。将此类原则(即宪法)注入模型是资源密集、技术挑战大的,通常需要人类偏好标签或示例。我们提出SAMI,一种迭代算法,微调预训练语言模型(无需偏好标签或示范),以增加给定数据集查询条件下宪法与自生成响应之间的条件互信息。在单轮对话和摘要任务上,SAMI训练的mistral-7b优于初始预训练模型,胜率在66%到77%之间。引人注目的是,它在单轮对话上也超越了指令微调基线(mistral-7b-instruct),胜率在55%到57%之间。SAMI需要一个能编写原则的模型。为避免依赖强模型编写原则,我们使用弱指令微调模型(mistral-7b-instruct)编写的宪法来对齐强预训练模型(mixtral-8x7b),在摘要任务上达到65%的胜率。最后,我们研究了SAMI是否能泛化到多样的摘要原则(例如“摘要应具有科学性”)并扩展到更强模型(llama3-70b),发现与基础模型相比,它在学习原则上的胜率高达68%,在保留原则上的胜率高达67%。我们的结果表明,预训练LM可以在不使用偏好标签、示范或人类监督的情况下学习遵循宪法。
引用
@article{arxiv.2404.14313,
title = {Self-Supervised Alignment with Mutual Information: Learning to Follow Principles without Preference Labels},
author = {Jan-Philipp Fränken and Eric Zelikman and Rafael Rafailov and Kanishk Gandhi and Tobias Gerstenberg and Noah D. Goodman},
journal= {arXiv preprint arXiv:2404.14313},
year = {2024}
}