向混合评分器迈出一步:对现有自动评估指标的统计分析
计算与语言
2024-10-15 v1 人工智能
摘要
开源模型和问答 (QA) 数据集的爆炸式增长凸显了自动化 QA 评估的重要性。我们研究了现有评估指标的统计情况,以更好地理解其局限性。通过测量每个评估指标与人类似的评估得分之间的相关系数,我们观察到:(1) 现有指标在问答类型(例如,单字、单词组等)方面彼此高度相关;(2) 没有单一指标能充分估计人类似的评估。作为潜在解决方案,我们讨论了混合评分器( Mixture Of Grader)在提高自动 QA 评估器质量方面的可能作用。
引用
@article{arxiv.2410.10030,
title = {A Step Towards Mixture of Grader: Statistical Analysis of Existing Automatic Evaluation Metrics},
author = {Yun Joon Soh and Jishen Zhao},
journal= {arXiv preprint arXiv:2410.10030},
year = {2024}
}