中文

创意自然语言生成系统的人类评估:近期论文的跨学科综述

计算与语言 2021-08-03 v1

摘要

我们综述了在INLG 2020与ICCC 2020上发表的、呈现创意自然语言生成工作的论文中的人类评估。最典型的人类评估方法是量表调查,通常采用5分制,同时也存在许多其他较不常用的方法。最常评估的参数包括意义、句法正确性、新颖性、相关性与情感价值等。我们面向未来评估的准则包括:清晰定义生成系统的目标、提问尽可能具体、测试评估设置、使用多种不同评估设置、清晰报告整个评估过程与潜在偏差,以及最终以比仅报告最典型统计量更为深入的方式分析评估结果。

关键词

引用

@article{arxiv.2108.00308,
  title  = {Human Evaluation of Creative NLG Systems: An Interdisciplinary Survey on Recent Papers},
  author = {Mika Hämäläinen and Khalid Alnajjar},
  journal= {arXiv preprint arXiv:2108.00308},
  year   = {2021}
}

备注

Proceedings of the 1st Workshop on Natural Language Generation, Evaluation, and Metrics (GEM 2021)