中文

真实世界人机交互时代:从用户对话中学习强化学习

人工智能 2025-09-30 v1 计算与语言 机器学习

摘要

我们提出,为了实现模型的持续改进与多维度对齐,未来的模型必须从自然的人类交互中学习。当前的对话模型使用预先标注的、专家生成的人类反馈进行对齐。在本工作中,我们引入了人类交互强化学习(RLHI),这是一种直接从真实世界用户对话中学习的范式。我们开发了两种互补的方法:(1)基于用户引导重写的 RLHI,根据用户的自然语言后续回复修改不令人满意的模型输出;(2)基于用户奖励的 RLHI,通过以用户的长期交互历史知识(称为 persona)为条件的奖励模型进行学习。这两种方法共同通过 persona 条件偏好优化将长期用户 persona 与轮次级偏好联系起来。在基于 WildChat 衍生的对话数据上训练后,两种 RLHI 变体在个性化和指令遵循方面均优于强基线,且类似的反馈增强了在推理基准上的性能。这些结果表明,有机的人类交互为个性化对齐提供了可扩展且有效的监督。

关键词

引用

@article{arxiv.2509.25137,
  title  = {The Era of Real-World Human Interaction: RL from User Conversations},
  author = {Chuanyang Jin and Jing Xu and Bo Liu and Leitian Tao and Olga Golovneva and Tianmin Shu and Wenting Zhao and Xian Li and Jason Weston},
  journal= {arXiv preprint arXiv:2509.25137},
  year   = {2025}
}