基于白盒特征的大语言模型自评估
计算与语言
2024-09-30 v2
摘要
开源大语言模型 (LLMs) 的激增凸显了对评估方法的迫切需求。现有工作主要依赖外部评估器,专注于训练和提示策略。然而,一个关键方面,即模型感知的白盒特征,被忽视了。在本研究中,我们探讨了白盒特征在自评估场景下的效用,即应用 LLM 评估其自身的输出。我们调查了各种白盒特征组,发现 softmax 分布可作为自评估的可靠质量指标。在公共基准上的实验结果验证了使用白盒特征进行 LLM 自评估的可行性。
引用
@article{arxiv.2403.04222,
title = {Self-Evaluation of Large Language Model based on Glass-box Features},
author = {Hui Huang and Yingqi Qu and Jing Liu and Muyun Yang and Bing Xu and Tiejun Zhao and Wenpeng Lu},
journal= {arXiv preprint arXiv:2403.04222},
year = {2024}
}
备注
accepted as Findings of EMNLP2024