从用户交互中对齐语言模型
计算与语言
2026-03-16 v1 人工智能
机器学习
摘要
多轮用户交互是语言模型产生的海量数据,但我们缺乏有效的方法从中进行学习。虽然通常被忽略,这些交互常包含有用信息:后续用户消息可能表明先前的回复不正确、未遵循指令,或未符合用户偏好。重要的是,语言模型已经能够在上下文中利用这一信息。观察到用户后续消息后,同一模型往往能够修正其行为。我们利用这一能力,提出一种原则性且可扩展的直接从用户交互中学习的方法,通过自蒸馏实现。通过对用户后续消息进行条件化,并将生成的 token 分布与原始策略进行比较,我们获得一种目标,用于更新策略,捕捉模型行为在事后如何变化。我们随后将这一 hindsight 分布蒸馏回当前策略。惊人的是,我们展示,在野生聊天(WildChat)中的真实用户对话训练后,语言模型在标准对齐和指令遵循基准测试中均取得提升,同时未出现其他能力退步。相同机制也实现了个人化,使模型能够通过交互持续适应 individual users,无需显式反馈。我们的结果表明,部署期间自然产生的原始用户交互能够实现对齐、个人化和持续适应。
引用
@article{arxiv.2603.12273,
title = {Aligning Language Models from User Interactions},
author = {Thomas Kleine Buening and Jonas Hübotter and Barna Pásztor and Idan Shenfeld and Giorgia Ramponi and Andreas Krause},
journal= {arXiv preprint arXiv:2603.12273},
year = {2026}
}