真实世界人机交互时代:从用户对话中学习强化学习
人工智能
2025-09-30 v1 计算与语言
机器学习
摘要
我们提出,为了实现模型的持续改进与多维度对齐,未来的模型必须从自然的人类交互中学习。当前的对话模型使用预先标注的、专家生成的人类反馈进行对齐。在本工作中,我们引入了人类交互强化学习(RLHI),这是一种直接从真实世界用户对话中学习的范式。我们开发了两种互补的方法:(1)基于用户引导重写的 RLHI,根据用户的自然语言后续回复修改不令人满意的模型输出;(2)基于用户奖励的 RLHI,通过以用户的长期交互历史知识(称为 persona)为条件的奖励模型进行学习。这两种方法共同通过 persona 条件偏好优化将长期用户 persona 与轮次级偏好联系起来。在基于 WildChat 衍生的对话数据上训练后,两种 RLHI 变体在个性化和指令遵循方面均优于强基线,且类似的反馈增强了在推理基准上的性能。这些结果表明,有机的人类交互为个性化对齐提供了可扩展且有效的监督。
引用
@article{arxiv.2509.25137,
title = {The Era of Real-World Human Interaction: RL from User Conversations},
author = {Chuanyang Jin and Jing Xu and Bo Liu and Leitian Tao and Olga Golovneva and Tianmin Shu and Wenting Zhao and Xian Li and Jason Weston},
journal= {arXiv preprint arXiv:2509.25137},
year = {2025}
}