SpeakRL:在语言模型中融合推理、言语与行动的强化学习方法
人工智能
2025-12-16 v1 计算与语言
摘要
有效的人类-代理人协作在实际应用中日益普及。当前这种协作的趋势主要是单向的,用户提供指令或提出问题,而代理人直接作出响应,而不主动寻求必要的澄清或确认。然而,随着这些代理人能力的不断提升,已需要更主动的参与,对话中主动寻求澄清、解决模糊性并适应不断变化的情境。现有的研究未充分利用语言模型(LM)的对话能力,从而将代理人优化为更好的跟随者,而非有效的说话者。在本工作中,我们引入SpeakRL,这是一种强化学习(RL)方法,通过奖励与用户的主动互动来增强代理人的对话能力,例如在必要时提出恰当的澄清问题。为支持这一目标,我们构建了SpeakER数据集,包含来自任务导向对话的多样化情景,这些情景通过交互式澄清问题来解决。我们对对话主动性的奖励设计进行了系统性分析,并提出了原则性的奖励表述,以教导代理人在提问与行动之间进行平衡。实证评估表明,我们的方法在不增加对话轮数的前提下,相较于基线模型实现了20.14%的绝对提升,甚至超过了很多更大的专有模型,展示了以澄清为中心的用户-代理人互动的前景。
引用
@article{arxiv.2512.13159,
title = {SpeakRL: Synergizing Reasoning, Speaking, and Acting in Language Models with Reinforcement Learning},
author = {Emre Can Acikgoz and Jinoh Oh and Jie Hao and Joo Hyuk Jeon and Heng Ji and Dilek Hakkani-Tür and Gokhan Tur and Xiang Li and Chengyuan Ma and Xing Fan},
journal= {arXiv preprint arXiv:2512.13159},
year = {2025}
}