TextClass 基准:社会科学领域中 LLM 文本分类的连续 Elo 评级
计算与语言
2024-12-10 v2 人工智能
摘要
TextClass 基准项目是一个持续进行的基准测试过程,旨在为 LLM 和 transformer 在社会科学领域中用于文本分类任务的综合、公平且动态评估提供可能。该评估跨越社会科学领域中的各种学科,涵盖 NLP 和文本作为数据方法。leaderboard 呈现性能指标和相对排名,使用量身定制的 Elo 评级系统。每个 leaderboard 周期中,都添加了新模型,固定的测试集可被替换为未看到的等效数据,以测试一般化能力,更新评级,并有一个 Meta-Elo leaderboard 将和加权 domain-specific leaderboard。本文阐述了该项目的理念和动机,详细解释了 Elo 评级系统,并估计了 Meta-Elo 在社会科学学科中不同分类任务中的情况。我们还呈现了第一个分类任务周期在中文、英文、德文和俄文 incivility 数据上的快照。该持续的基准测试过程不仅包括额外语言(如阿拉伯语、印地语和西班牙语),还包括对政策议程主题、误导信息等的分类。
引用
@article{arxiv.2412.00539,
title = {TextClass Benchmark: A Continuous Elo Rating of LLMs in Social Sciences},
author = {Bastián González-Bustamante},
journal= {arXiv preprint arXiv:2412.00539},
year = {2024}
}
备注
Working paper: 6 pages, 2 figures