中文

英语文本的跨语料可读性兼容性评估

计算与语言 2023-09-14 v2

摘要

文本可读性评估已获得各领域研究人员的显著关注。然而,由于不同研究团体使用不同语料,对语料兼容性的探索缺乏构成了挑战。在本研究中,我们提出一种新颖的评估框架——跨语料文本可读性兼容性评估(CRCA),以解决此问题。该框架包含三个关键组成部分:(1)语料:CEFR、CLEC、CLOTH、NES、OSP和RACE。提取了语言特征、GloVe词向量表示及其融合特征。(2)分类模型:采用了机器学习方法(XGBoost、SVM)和深度学习方法(BiLSTM、Attention-BiLSTM)。(3)兼容性度量:RJSD、RRNSS和NDCG度量。我们的发现揭示:(1)验证了语料兼容性,其中OSP与其他数据集显著不同。(2)语料、特征表示和分类方法之间存在适配效应。(3)三个度量下结果一致,验证了兼容性评估框架的鲁棒性。本研究结果为语料选择、特征表示和分类方法提供了有价值的见解,也可作为跨语料迁移学习的初步努力。

关键词

引用

@article{arxiv.2306.09704,
  title  = {Cross-corpus Readability Compatibility Assessment for English Texts},
  author = {Zhenzhen Li and Han Ding and Shaohong Zhang},
  journal= {arXiv preprint arXiv:2306.09704},
  year   = {2023}
}

备注

14 pages,17 figures