面向大型语言模型的 S.C.O.R.E. 评估框架:安全性、共识性、客观性、可重复性与可解释性
计算与语言
2024-07-11 v1 人工智能
摘要
我们提出了一个针对大型语言模型 (LLM) 的全面定性评估框架,超越传统准确度和量化指标的需求。我们提出 5 个关键评估维度:安全性 (Safety)、共识性 (Consensus)、客观性 (Objectivity)、可重复性 (Reproducibility) 和 可解释性 (Explainability) (S.C.O.R.E.)。我们认为 S.C.O.R.E. 可能为未来基于 LLM 的模型评估框架奠定基础,这些模型在医疗保健领域应是安全、可靠、可信且符合伦理的。
引用
@article{arxiv.2407.07666,
title = {A Proposed S.C.O.R.E. Evaluation Framework for Large Language Models : Safety, Consensus, Objectivity, Reproducibility and Explainability},
author = {Ting Fang Tan and Kabilan Elangovan and Jasmine Ong and Nigam Shah and Joseph Sung and Tien Yin Wong and Lan Xue and Nan Liu and Haibo Wang and Chang Fu Kuo and Simon Chesterman and Zee Kin Yeong and Daniel SW Ting},
journal= {arXiv preprint arXiv:2407.07666},
year = {2024}
}