中文

指称生成模型:它们如何经受时间的考验?

计算与语言 2023-07-28 v1

摘要

近年来,许多NLP研究仅关注性能提升。在这项工作中,我们关注NLP的语言学与科学层面。我们以语境中生成指称表达(REG-in-context)任务为案例研究,并从GREC入手——这是十多年前针对该主题的一系列综合性英语共享任务。我们探讨若以(1)更真实的数据集与(2)更先进的方法评估模型,其表现会如何。我们使用不同的评估指标与特征选择实验来测试模型。我们得出结论:GREC不能再被视为对模型模仿人类指称生成能力的可靠评估,因为结果深受语料库与评估指标选择的影响。我们的结果还表明,预训练语言模型比经典机器学习模型更少依赖语料库选择,因而做出更稳健的类别预测。

关键词

引用

@article{arxiv.2307.14817,
  title  = {Models of reference production: How do they withstand the test of time?},
  author = {Fahime Same and Guanyi Chen and Kees van Deemter},
  journal= {arXiv preprint arXiv:2307.14817},
  year   = {2023}
}

备注

Accepted to INLG 2023