中文

宏平均:稀有类型同样重要

计算与语言 2022-09-16 v1 人工智能 机器学习

摘要

虽然传统的语料库级机器翻译(MT)评测指标与流畅度相关性良好,却难以反映充分性。基于片段级人工评判训练的模型化 MT 指标因强相关性结果而成为颇具吸引力的替代方案。然而,这些模型在新领域和新语言上可能需要代价高昂的重新训练。此外,其决策本质上不透明,且似乎反映出不受欢迎的偏差。我们探究了简单的基于类型的分类器指标 MacroF1,并研究其在 MT 评测中的适用性。我们发现 MacroF1 在直接评估上具有竞争力,并在指示下游跨语言信息检索任务性能方面优于其他指标。进一步,我们展示了 MacroF1 可有效用于比较有监督与无监督神经机器翻译,并揭示两种方法输出间显著的定性差异。

关键词

引用

@article{arxiv.2104.05700,
  title  = {Macro-Average: Rare Types Are Important Too},
  author = {Thamme Gowda and Weiqiu You and Constantine Lignos and Jonathan May},
  journal= {arXiv preprint arXiv:2104.05700},
  year   = {2022}
}