中文

通过元排序使弱 LLM 能够评判响应可靠性

计算与语言 2024-06-03 v3 人工智能 机器学习

摘要

尽管大型语言模型(LLM)在广泛任务中表现出色,但它们仍存在可靠性问题。先前研究表明,像 GPT-4-turbo 这样的强 LLM 在评估 LLM 响应的可靠性方面表现优异,但面临效率和本地部署问题。因此,为了使弱 LLM 能够有效评估 LLM 响应的可靠性,我们提出了一种新颖的基于跨查询比较的方法,称为 Meta Ranking\textit{Meta Ranking} (MR)。与以往仅依赖 LLM 上下文学习能力的少样本方法不同,MR 通过将目标查询-响应对与多个参考查询-响应对进行成对排序来评估可靠性。我们发现 MR 在 LLM 响应的错误检测中非常有效,其中像 Phi-2 这样的弱 LLM 可以超越像 GPT-3.5-turbo 这样的强基线,且仅需五个参考样本,并显著提高效率。我们进一步证明,MR 可以在两个实际应用中增强强 LLM 的性能:模型级联和指令微调。在模型级联中,我们结合开源和闭源 LLM,以更低的成本实现与 GPT-4-turbo 相当的性能。在指令微调中,我们使用 MR 进行迭代训练数据过滤,显著减少了数据处理时间,并使 LLaMA-7B 和 Phi-2 能够以更少的训练 token 超越 Alpaca-13B。这些结果突显了 MR 在效率和有效性方面的巨大潜力。

关键词

引用

@article{arxiv.2402.12146,
  title  = {Enabling Weak LLMs to Judge Response Reliability via Meta Ranking},
  author = {Zijun Liu and Boqun Kou and Peng Li and Ming Yan and Ji Zhang and Fei Huang and Yang Liu},
  journal= {arXiv preprint arXiv:2402.12146},
  year   = {2024}
}

备注

Preprint, under review. 28 pages