中文

通过协作自我对弈学习可引导的澄清策略

机器学习 2026-01-14 v2

摘要

为处理不明确或模糊的查询,AI 助手需要一种管理其不确定性的策略,以确定 (a) 何时猜测用户意图并直接作答、(b) 何时枚举并回答多个可能的意图、(c) 何时提出澄清问题。然而,这些策略在诸如用户偏好或介质等情境依赖因素影响下是上下文相关的。例如,在小屏幕或语音环境中,枚举多个用户意图会很麻烦。在本工作中,我们提出使用自我对弈来训练可引导的策略,以管理这种不确定性。给定两个代理人,一个模拟用户,另一个则是 AI 助手,我们生成对话,其中用户提出可能含糊的查询,助手需要确定如何回应。重要的是,模型以每个澄清问题和每个生成单词的数值成本为输入,并被要求采取能最大化最终奖励的动作,该奖励是成本惩罚下的准确性。我们使用受控自我训练(ReST)训练模型以获得高奖励,并发现这导致一种可引导的策略,其行为会根据提供的成本而可预测地变化,从而实现更高的奖励和准确性。此外,我们的程序也能推广到训练时未观察到的数值成本。

关键词

引用

@article{arxiv.2512.04068,
  title  = {Learning Steerable Clarification Policies with Collaborative Self-play},
  author = {Jonathan Berant and Maximillian Chen and Adam Fisch and Reza Aghajani and Fantine Huot and Mirella Lapata and Jacob Eisenstein},
  journal= {arXiv preprint arXiv:2512.04068},
  year   = {2026}
}