一致性至关重要:从黑盒视角探索大语言模型的一致性
计算与语言
2024-03-05 v2
摘要
如今,商业和开源学术大语言模型(LLM)已成为自然语言处理的主流模型。然而,关于 LLM 一致性的研究仍然缺乏,这意味着在 LLM 研究和部署的各个阶段,其内部参数和能力应保持不变。这一问题在工业界和学术界均存在。解决该问题通常耗时费力,且涉及额外的二次部署成本,导致经济和时间的损失。为了填补这一空白,我们构建了一个 LLM 一致性任务数据集并设计了若干基线。此外,我们选择了不同规模的模型进行主要实验。具体而言,在 LightGBM 实验中,我们使用传统的自然语言生成(NLG)指标(即 ROUGE、BLEU、METEOR)作为模型训练所需的特征。最终结果在主要实验中超过了人工评估、GPT-3.5 以及其他模型,取得了最佳性能。最后,我们使用表现最佳的 LightGBM 模型作为基础模型构建了评估工具,可有效辅助业务模型的部署。我们的代码和工具演示可在 https://github.com/heavenhellchen/Consistency.git 获取。
引用
@article{arxiv.2402.17411,
title = {Consistency Matters: Explore LLMs Consistency From a Black-Box Perspective},
author = {Fufangchen Zhao and Guoqiang Jin and Jiaheng Huang and Rui Zhao and Fei Tan},
journal= {arXiv preprint arXiv:2402.17411},
year = {2024}
}
备注
This paper is not ready