预测英文文本中的词汇复杂度:CompLex 2.0 数据集
计算与语言
2022-11-04 v2
摘要
识别可能给读者带来困难的词,是大多数词汇文本简化系统在词汇替换之前的关键步骤,也可用于评估文本的可读性。该任务通常被称为复杂词识别(CWI),并常被建模为监督分类问题。为训练此类系统,需要标注数据集,其中词以及有时多词表达式被标注了复杂度。本文中我们分析该任务的已有工作,并考察英文 CWI 数据集的特性。我们制定了一套词汇复杂度标注协议,并据此标注了一个新数据集 CompLex 2.0。我们采用新旧数据集进行实验以探究词汇复杂度的本质。我们发现,与二值标注协议相比,Likert 量表标注协议提供了一种客观设定,更优地识别词的复杂度。我们采用新协议发布了一个新数据集,以推动词汇复杂度预测任务的发展。
引用
@article{arxiv.2102.08773,
title = {Predicting Lexical Complexity in English Texts: The Complex 2.0 Dataset},
author = {Matthew Shardlow and Richard Evans and Marcos Zampieri},
journal= {arXiv preprint arXiv:2102.08773},
year = {2022}
}