Jury:一个综合评估工具包
计算与语言
2024-05-21 v2 人工智能
摘要
评估在深度学习中作为任何基于预测的系统的基本模块起着关键作用。然而,自然语言处理(NLP)任务的数量庞大以及各种度量指标的发展,导致了用不同指标评估不同系统的挑战。为应对这些挑战,我们引入了 jury,一个提供统一评估框架和标准化结构的工具包,用于跨不同任务和指标执行评估。jury 的目标是标准化并改进对所有系统的指标评估,并帮助社区克服评估中的挑战。自开源发布以来,jury 已拥有广泛受众,可在 https://github.com/obss/jury 获取。
引用
@article{arxiv.2310.02040,
title = {Jury: A Comprehensive Evaluation Toolkit},
author = {Devrim Cavusoglu and Secil Sen and Ulas Sert and Sinan Altinuc},
journal= {arXiv preprint arXiv:2310.02040},
year = {2024}
}
备注
authors order corrected