BasahaCorpus:面向中菲律宾诸语言可读性评估的扩展语言资源
计算与语言
2023-10-19 v1
摘要
当前关于自动可读性评估(ARA)的研究集中于提升英语等高资源语言中模型的性能。本工作中,我们引入并发布 BasahaCorpus,作为旨在扩展菲律宾低资源语言可读性评估可用语料库与基线模型举措的一部分。我们编纂了由希利盖农语、米纳斯巴特语、卡拉亚语和林科纳达语——属于中菲律宾语族子树的语言——写成的短篇虚构叙事语料库,以利用表层、音节模式与 n-gram 重叠特征训练 ARA 模型。我们还提出一种新的分层跨语言建模方法,利用语言在语族树中的位置来增加可用训练数据量。我们的研究取得了令人鼓舞的结果,支持了先前展示跨语言模型在低资源环境下有效性的工作,以及相互可理解语言间高信息量语言特征的相似性。
引用
@article{arxiv.2310.11584,
title = {BasahaCorpus: An Expanded Linguistic Resource for Readability Assessment in Central Philippine Languages},
author = {Joseph Marvin Imperial and Ekaterina Kochmar},
journal= {arXiv preprint arXiv:2310.11584},
year = {2023}
}
备注
Final camera-ready paper for EMNLP 2023 (Main)