Echo-N1: 带情感的强化学习前沿
人工智能
2025-12-02 v1
摘要
LLM 领域花了一年时间打磨RL,用于机器已经擅长的任务,如数学、代码和确定性推理,而完全绕开了实际定义人类智力的领域:主观的、情感驱动的、 personality sensitive 的对话。该空间常被视为本质上是主观且难以形式化的,因而不适合常规RL管道。我们证明这不仅是可能的,而且是一个可解决且具有变革性的RL问题。我们提出了第一个能够动态推断用户 personality 并优化模型行为以实现个性化对话偏好的框架。与普遍认为RL在非可验证环境中会崩溃的观念相反,我们的方法产生了一致、稳健且显著提高的人类化交互质量。我们还引入了第一个动态情感智能评估套件来量化这些收益。我们的模型,称为Echo-N1,表现出远超其基础版本的水平,甚至超过专属的豆包1.5 Character。本工作确立了RL的新前沿:针对对话中深刻的主观性、深刻的人类维度进行优化。
引用
@article{arxiv.2512.00344,
title = {Echo-N1: Affective RL Frontier},
author = {Naifan Zhang and Ruihan Sun and Ruixi Su and Shiqi Ma and Shiya Zhang and Xianna Weng and Xiaofan Zhang and Yuhan Zhan and Yuyang Xu and Zhaohan Chen and Zhengyuan Pan and Ziyi Song},
journal= {arXiv preprint arXiv:2512.00344},
year = {2025}
}