Ranger:基于效应量的多任务评估工具包
计算与语言
2023-05-25 v1 信息检索
摘要
本文介绍 Ranger——一个促进在自然语言处理(NLP)与信息检索(IR)中便捷使用基于效应量的元分析进行多任务评估的工具包。我们观察到,我们的社区常面临将不可比指标与场景下的结果进行聚合的挑战,这使得结论与要点信息可靠性降低。借助 Ranger,我们旨在通过一个任务无关的工具包解决此问题,该工具包将某一处理在多个任务上的效应合并为单一统计评估,从而允许指标比较与总体摘要效应的计算。我们的工具包生成可用于发表的森林图,能够清晰传达多任务上的评估结果。我们推出即用型 Ranger 工具包的目标在于推动稳健的、基于效应量的评估,并提升社区内的评估标准。我们提供了针对常见 IR 与 NLP 设置的两个案例研究,以凸显 Ranger 的优势。
引用
@article{arxiv.2305.15048,
title = {Ranger: A Toolkit for Effect-Size Based Multi-Task Evaluation},
author = {Mete Sertkan and Sophia Althammer and Sebastian Hofstätter},
journal= {arXiv preprint arXiv:2305.15048},
year = {2023}
}
备注
Accepted at ACL 2023 (System Demonstrations)