关于自动评估与任务框架在标题风格转换中的交互
计算与语言
2021-01-06 v1
摘要
NLG 社区中一个持续的争论涉及评估系统的最佳方式,与基于语料的度量相比,人工评估常被认为是最可靠的方法。然而,涉及细微文本差异的任务(如风格转换)往往难以由人工完成。在本文中,我们提出一种基于专门训练分类器的该任务评估方法,表明其比 BLEU 和 ROUGE 等传统度量更好地反映系统差异。
引用
@article{arxiv.2101.01634,
title = {On the interaction of automatic evaluation and task framing in headline style transfer},
author = {Lorenzo De Mattei and Michele Cafagna and Huiyuan Lai and Felice Dell'Orletta and Malvina Nissim and Albert Gatt},
journal= {arXiv preprint arXiv:2101.01634},
year = {2021}
}