中文

TO-GATE:通过轨迹优化澄清问题与总结响应以激发人类偏好

计算与语言 2025-06-04 v1

摘要

大语言模型(LLM)可以通过多轮对话有效激发人类偏好。复杂任务可以通过迭代澄清问题和由 LLM 作为提问者生成的最终响应来完成(STaR-GATE; Andukuri et al., 2024)。然而,现有的基于自教推理的方法难以识别最优对话轨迹并避免与任务无关的问题。为解决这一局限性,我们提出了 TO-GATE,一个通过轨迹优化增强问题生成的新框架,它包含两个关键组件:生成最优提问轨迹的澄清解析器,以及确保任务对齐最终响应的摘要器。轨迹优化使模型能够生成针对特定任务的有效激发问题和摘要响应。实验结果表明,TO-GATE 显著优于基线方法,在标准偏好激发任务上实现了 9.32% 的提升。

关键词

引用

@article{arxiv.2506.02827,
  title  = {TO-GATE: Clarifying Questions and Summarizing Responses with Trajectory Optimization for Eliciting Human Preference},
  author = {Yulin Dou and Jiangming Liu},
  journal= {arXiv preprint arXiv:2506.02827},
  year   = {2025}
}