中文

基于匿名众包平台的大语言模型个性化评估

计算与语言 2024-03-14 v1

摘要

大语言模型评估在提升其能力方面起着关键作用。此前,该领域已提出众多评估大语言模型的方法。尽管这些方法有效,但现有工作主要侧重于评估客观问题,忽视了对大语言模型极为常见的主观问题的评估能力。此外,这些方法主要利用集中式数据集进行评估,题库集中于评估平台自身。而且,这些平台采用的评估过程常常忽略个性化因素,未考虑评估者和被评估模型的个体特征。为解决这些局限,我们提出了一个新颖的匿名众包评估平台——BingJian,用于大语言模型,该平台采用竞争性评分机制,用户根据模型表现参与排名。该平台不仅支持集中式评估以衡量模型的一般能力,还提供了一个开放的评估入口。通过此入口,用户有机会提交自己的问题,从而在个性化且可能更广泛的能力范围内测试模型。此外,我们的平台引入了个性化评估场景,利用多种形式的人机交互,以考虑个体用户偏好和上下文的方式评估大语言模型。BingJian 的演示可通过 https://github.com/Mingyue-Cheng/Bingjian 访问。

关键词

引用

@article{arxiv.2403.08305,
  title  = {Towards Personalized Evaluation of Large Language Models with An Anonymous Crowd-Sourcing Platform},
  author = {Mingyue Cheng and Hao Zhang and Jiqian Yang and Qi Liu and Li Li and Xin Huang and Liwei Song and Zhi Li and Zhenya Huang and Enhong Chen},
  journal= {arXiv preprint arXiv:2403.08305},
  year   = {2024}
}