中文

基于 Evalica 的可靠、可复现且极快的排行榜

计算与语言 2024-12-17 v1

摘要

自然语言处理(NLP)技术的快速发展,例如经过指令微调的大型语言模型(LLM),迫切需要结合人类与机器反馈的现代评估协议。我们介绍了 Evalica,这是一个开源工具包,旨在促进可靠且可复现的模型排行榜的创建。本文介绍了其设计,评估了其性能,并通过其 Web 界面、命令行界面和 Python API 展示了其可用性。

关键词

引用

@article{arxiv.2412.11314,
  title  = {Reliable, Reproducible, and Really Fast Leaderboards with Evalica},
  author = {Dmitry Ustalov},
  journal= {arXiv preprint arXiv:2412.11314},
  year   = {2024}
}

备注

accepted at COLING 2025 system demonstration track