中文

学习提出有信息问题:通过偏好优化和预期信息增益增强大语言模型

计算与语言 2024-10-18 v3

摘要

问题是获取完成信息寻求任务所必需信息的 essential tool。然而,大型语言模型(LLM),特别是开源模型,在生成信息性问题方面往往表现不佳,这些问题按预期信息增益(EIG)进行衡量。本文提出了一种方法来增强 LLM 生成的问题的可信度,这些方法适用于 20 问题游戏对话。我们为每个游戏从同一模型(LLAMA 2-CHAT 7B)中抽取多个问题,并创建低-EIG 和高-EIG 的问题对,以应用直接偏好优化(DPO)算法。我们的结果表明,该方法产生更有效的问题(以 EIG 为准),即使在用于训练 DPO 模型的领域不同于该领域也同样有效。

关键词

引用

@article{arxiv.2406.17453,
  title  = {Learning to Ask Informative Questions: Enhancing LLMs with Preference Optimization and Expected Information Gain},
  author = {Davide Mazzaccara and Alberto Testoni and Raffaella Bernardi},
  journal= {arXiv preprint arXiv:2406.17453},
  year   = {2024}
}

备注

Accepted to EMNLP 2024 (Findings)