中文

面向密切关联语言的自动可读性评估

计算与语言 2023-05-26 v2

摘要

近年来,自动可读性评估(ARA)的研究重心已转向使用昂贵的基于深度学习的方法,其主要目标是提升模型的准确率。然而,这对于低资源语言很少适用,由于缺乏现有 NLP 工具来提取更深层的语言表示,传统手工特征仍被广泛使用。本工作中,我们从技术组件退后一步,关注互懂性或语言关联程度等语言层面因素如何在低资源设定下改进 ARA。我们收集了菲律宾三种语言——他加禄语、比科尔语和宿务语——写成的短篇故事来训练可读性评估模型,并探索多种跨语言设定下数据与特征的交互。我们的结果表明,引入 CrossNGO(一种利用 n-gram 重叠、应用于高互懂性语言的新型专用特征)相比单独使用现成大型多语言语言模型,显著提升了 ARA 模型的性能。因此,当两种语言表示结合时,我们在他加禄语和宿务语上取得了 SOTA 结果,并在比科尔语上获得了 ARA 的基线分数。

关键词

引用

@article{arxiv.2305.13478,
  title  = {Automatic Readability Assessment for Closely Related Languages},
  author = {Joseph Marvin Imperial and Ekaterina Kochmar},
  journal= {arXiv preprint arXiv:2305.13478},
  year   = {2023}
}

备注

Camera-ready version for ACL 2023