CLSE:具有语言学显著性实体的语料库
计算与语言
2023-08-31 v2
摘要
自然语言生成(NLG)最大的挑战之一是对命名实体的恰当处理。命名实体是语法错误的常见来源,例如错误的介词、错误的冠词处理或错误的实体变格。若不考量语言学表征,当在任意选取的少量参数值上评估,或将数据集从英语等语言学较简单的语言翻译至俄语等语言学较复杂的语言时,此类错误往往被低估。然而,对于某些应用,广泛精确的语法正确性至关重要——母语者可能会觉得与实体相关的语法错误可笑、突兀甚至冒犯。为支持创建更具语言学多样性的 NLG 数据集,我们发布了由语言学专家标注的具有语言学显著性实体的语料库(CLSE)。该语料库涵盖 34 种语言与 74 种不同语义类型,可支撑从机票预订到电子游戏等各类应用。为展示 CLSE 的一种可能用途,我们生成了 Schema-Guided Dialog Dataset 的增强版本 SGD-CLSE。利用 CLSE 的实体与少量人工翻译,我们创建了三种语言下具有语言学代表性的 NLG 评估基准:法语(高资源)、马拉地语(低资源)与俄语(高度屈折语言)。我们为神经、基于模板及混合 NLG 系统建立了质量基线,并讨论了各方法的优劣。
引用
@article{arxiv.2211.02423,
title = {CLSE: Corpus of Linguistically Significant Entities},
author = {Aleksandr Chuklin and Justin Zhao and Mihir Kale},
journal= {arXiv preprint arXiv:2211.02423},
year = {2023}
}
备注
Proceedings of the 2nd Workshop on Natural Language Generation, Evaluation, and Metrics (GEM 2022) at EMNLP 2022