中文

STaR-GATE: 教导语言模型提出澄清性问题

计算与语言 2024-08-09 v3 人工智能

摘要

在提示语言模型完成任务时,用户常常遗漏重要细节。虽然提出问题可以解决这种歧义(GATE; Li et al., 2023),但模型往往难以提出好的问题。我们探索了语言模型通过奖励其生成有用问题来实现自我改进(STaR; Zelikman et al., 2022)的能力——我们将这种简单方法称为 STaR-GATE。我们生成了一个包含 25,500 个独特角色-任务提示的合成数据集,以模拟预训练语言模型(提问者)与角色扮演者之间的对话,其中角色扮演者的偏好对提问者是未知的。通过提问,提问者从角色扮演者处引出偏好。提问者在那些能提高任务高质量回答概率的问题上进行迭代微调,这些高质量回答由一个能获知角色扮演者潜在偏好的 Oracle 生成。经过两次自我改进迭代后,提问者提出了更好的问题,使其在 72% 的任务上生成的回答优于初始模型的回答。我们的结果表明,教导语言模型提出更好的问题能带来更好的个性化回答。

关键词

引用

@article{arxiv.2403.19154,
  title  = {STaR-GATE: Teaching Language Models to Ask Clarifying Questions},
  author = {Chinmaya Andukuri and Jan-Philipp Fränken and Tobias Gerstenberg and Noah D. Goodman},
  journal= {arXiv preprint arXiv:2403.19154},
  year   = {2024}
}