创意自然语言生成系统的人类评估:近期论文的跨学科综述
计算与语言
2021-08-03 v1
摘要
我们综述了在INLG 2020与ICCC 2020上发表的、呈现创意自然语言生成工作的论文中的人类评估。最典型的人类评估方法是量表调查,通常采用5分制,同时也存在许多其他较不常用的方法。最常评估的参数包括意义、句法正确性、新颖性、相关性与情感价值等。我们面向未来评估的准则包括:清晰定义生成系统的目标、提问尽可能具体、测试评估设置、使用多种不同评估设置、清晰报告整个评估过程与潜在偏差,以及最终以比仅报告最典型统计量更为深入的方式分析评估结果。
引用
@article{arxiv.2108.00308,
title = {Human Evaluation of Creative NLG Systems: An Interdisciplinary Survey on Recent Papers},
author = {Mika Hämäläinen and Khalid Alnajjar},
journal= {arXiv preprint arXiv:2108.00308},
year = {2021}
}
备注
Proceedings of the 1st Workshop on Natural Language Generation, Evaluation, and Metrics (GEM 2021)