中文

基于外部代理指标反馈的语言模型自我精炼

计算与语言 2024-03-05 v1 人工智能 机器学习

摘要

大语言模型(LLMs)在提供响应时通常需要兼顾多个目标。例如,在文档驱动的响应生成中,智能体响应既要与用户查询相关,又要基于给定文档。在本文中,我们提出了基于代理指标的自我精炼(ProMiSe),它使LLM能够根据外部指标反馈,沿着质量的关键维度精炼其初始响应,从而产生整体更好的最终响应。ProMiSe通过特定原则的代理指标利用对响应质量的反馈,并一次一个原则地迭代精炼其响应。我们将ProMiSe应用于开源语言模型Flan-T5-XXL和Llama-2-13B-Chat,在文档驱动的问答数据集MultiDoc2Dial和QuAC上评估其性能,证明自我精炼提高了响应质量。我们进一步表明,在ProMiSe生成的合成对话数据上微调Llama-2-13B-Chat,相比零样本基线以及在人工标注数据上监督微调的模型,都取得了显著的性能提升。

关键词

引用

@article{arxiv.2403.00827,
  title  = {Self-Refinement of Language Models from External Proxy Metrics Feedback},
  author = {Keshav Ramji and Young-Suk Lee and Ramón Fernandez Astudillo and Md Arafat Sultan and Tahira Naseem and Asim Munawar and Radu Florian and Salim Roukos},
  journal= {arXiv preprint arXiv:2403.00827},
  year   = {2024}
}