中文

LLM-Blender:通过成对排序与生成式融合集成大语言模型

计算与语言 2023-07-04 v3 人工智能 机器学习

摘要

我们提出 LLM-Blender,一个集成框架,旨在通过利用多个开源大语言模型(LLM)的多样化优势来获得持续优越的性能。我们的框架由两个模块组成:PairRanker 和 GenFuser,以应对不同样本的最优 LLM 可能显著不同的观察。PairRanker 采用专门的成对比较方法来区分候选输出之间的细微差异。它联合编码输入文本和一对候选,使用交叉注意力编码器来确定较优的一个。我们的结果表明,PairRanker 与基于 ChatGPT 的排序表现出最高的相关性。随后,GenFuser 旨在合并排名靠前的候选,通过利用其优势并缓解其弱点来生成改进的输出。为促进大规模评估,我们引入了一个基准数据集 MixInstruct,它是具有神谕成对比较的多个指令数据集的混合。我们的 LLM-Blender 在各种指标上显著优于单个 LLM 和基线方法,建立了显著的性能差距。

关键词

引用

@article{arxiv.2306.02561,
  title  = {LLM-Blender: Ensembling Large Language Models with Pairwise Ranking and Generative Fusion},
  author = {Dongfu Jiang and Xiang Ren and Bill Yuchen Lin},
  journal= {arXiv preprint arXiv:2306.02561},
  year   = {2023}
}

备注

Accepted to ACL 2023 (main conference); Project website: https://yuchenlin.xyz/LLM-Blender/ V3 update: fix a few typos and update a few citations; V2 update: The experiments on summarization, translation, and constrained generation tasks in the prior version have been moved to the appendix