中文

对比评估中最小对的最小局限

计算与语言 2021-09-16 v1

摘要

最小句子对常被用于分析语言模型的行为。人们通常假设模型在对比对上的表现能够预测模型在大规模上的表现。我们认为该假设成立需满足两个条件:首先,被检验的假设应有充分动机,因为实验表明对比评估可能导致假阳性。其次,测试数据的选择应使评估时与部署时的分布差异最小化。为良好近似部署时的解码,我们建议基于机器生成文本而非人工撰写参考来创建最小对。我们提出了一个实现该建议的英德机器翻译对比评估套件。

关键词

引用

@article{arxiv.2109.07465,
  title  = {On the Limits of Minimal Pairs in Contrastive Evaluation},
  author = {Jannis Vamvas and Rico Sennrich},
  journal= {arXiv preprint arXiv:2109.07465},
  year   = {2021}
}

备注

BlackboxNLP 2021