中文

Student t分布:在观测稀缺时度量评分者间可靠性

计算与语言 2023-07-11 v2 信息论 数值分析 math.IT 数值分析 应用统计

摘要

在自然语言处理(NLP)中,我们始终依赖人工判断作为黄金质量评估方法。然而,关于如何更好地评估某些评估任务(如翻译质量评估(TQE))的评分者间可靠性(IRR)水平,尤其在数据样本(观测)非常稀缺时,一直存在争论。本工作中,我们首先研究了在仅有一个数据(评估)点可用时如何估计度量值的置信区间。进而引出包含两个人工生成观测分数的示例,对此我们引入“Student's t-Distribution”方法,并解释如何仅利用这两个数据点以及质量评估的置信区间(CIs)来度量IRR分数。我们给出了定量分析了引入更多观测(即便仅多一个观测)如何大幅改善评估置信度。我们鼓励研究者尽可能以各种方式报告其IRR分数,例如尽可能使用Student's t-Distribution方法;从而使NLP评估更有意义、透明和可信。该t-Distribution方法也可用于NLP领域之外,在观测数据稀缺时为实验研究的可靠评估度量IRR水平。关键词:评分者间可靠性(IRR);稀缺观测;置信区间(CIs);自然语言处理(NLP);翻译质量评估(TQE);Student's t-Distribution

关键词

引用

@article{arxiv.2303.04526,
  title  = {Student's t-Distribution: On Measuring the Inter-Rater Reliability When the Observations are Scarce},
  author = {Serge Gladkoff and Lifeng Han and Goran Nenadic},
  journal= {arXiv preprint arXiv:2303.04526},
  year   = {2023}
}

备注

Accepted to RANLP2023: Recent Advances in Natural Language Processing, Varna, Bulgaria. 30 Aug - 8 Sep \url{https://ranlp.org/ranlp2023/}