中文

指代表达生成的基于内在任务的评估

计算与语言 2024-02-13 v1

摘要

最近,一项针对指代表达生成(REG)模型的人工评估研究得出了一个意想不到的结论:在 \textsc{webnlg} 数据集上,由最先进神经模型生成的指代表达(REs)不仅与 \textsc{webnlg} 中的 REs 无法区分,甚至与简单基于规则的系统生成的 REs 也无法区分。在此,我们认为这一局限性可能源于纯粹基于评分的人工评估(这是自然语言生成中的常见做法)。为了调查这些问题,我们提出了一种针对 REG 模型的基于内在任务的评估方法,其中除了对 REs 的质量进行评分外,参与者还需完成两项元级任务。其中一项任务涉及每个 RE 的指代成功率;另一项任务要求参与者为每个 RE 提出更好的替代方案。结果表明,与之前的评估相比,新的评估协议更全面地评估了每个 REG 模型的性能,并使参与者的评分更加可靠和具有区分度。

关键词

引用

@article{arxiv.2402.07432,
  title  = {Intrinsic Task-based Evaluation for Referring Expression Generation},
  author = {Guanyi Chen and Fahime Same and Kees van Deemter},
  journal= {arXiv preprint arXiv:2402.07432},
  year   = {2024}
}