中文

Sotopia-RL:面向社交智能的奖励设计

计算与语言 2025-10-09 v3

摘要

社交智能已成为大型语言模型(LLM)的关键能力,使其能够在协作和谈判等现实社交任务中高效互动。强化学习(RL)因允许模型通过社交互动直接学习复杂策略而天然适用于训练社交智能代理。然而,社交智能任务存在两个独特特征:(1)社交互动中单个发言质量与最终成功结果并不严格相关;(2)社交互动需要多维成功评估标准。因此,我们认为必须设计奖励机制,以构建 utterance-level( utterance)的多维奖励模型,以促进社交智能任务的 RL 训练。为解决这些挑战,我们提出了 Sotopia-RL 框架,该框架将粗糙的 episode-level 反馈细化为 utterance-level 的多维奖励。 utterance-level 的信用分配将结果归因于单个发言,而多维奖励则全面捕捉社交互动的丰富性,减少奖励攻击风险。在开放社交学习环境 Sotopia 中的实验表明,Sotopia-RL 在 Sotopia-hard 上实现了 7.17 的社交目标完成分数,在 Sotopia-full 上实现了 8.31 的分数,显著优于现有方法。消融研究确认,对于 RL 训练, utterance-level 信用分配和多维奖励设计的确是必不可少的。

关键词

引用

@article{arxiv.2508.03905,
  title  = {Sotopia-RL: Reward Design for Social Intelligence},
  author = {Haofei Yu and Zhengyang Qi and Yining Zhao and Kolby Nottingham and Keyang Xuan and Bodhisattwa Prasad Majumder and Hao Zhu and Paul Pu Liang and Jiaxuan You},
  journal= {arXiv preprint arXiv:2508.03905},
  year   = {2025}
}

备注

10 pages