中文

基于众包数据集的波斯语文本可读性评估机器学习方法

计算与语言 2020-04-23 v4

摘要

自动文本可读性评估对一门语言至关重要,并可作为提升该语言所写及出版文本可理解性的有力工具。然而,拥有超 1.1 亿使用者的波斯语缺乏此类系统。与英语、法语、汉语等语言不同,针对波斯语构建准确可靠的文本可读性评估系统的研究极为有限。本研究收集了首个波斯语文本可读性评估数据集,并提出了首个基于机器学习的波斯语文本可读性评估模型。实验表明该模型准确,能以高置信度评估波斯语文本可读性。本研究结果可用于医疗与教育资源文本可读性评估等诸多应用,并有望成为未来波斯语文本可读性研究的基石。

关键词

引用

@article{arxiv.1810.06639,
  title  = {A Machine Learning Approach to Persian Text Readability Assessment Using a Crowdsourced Dataset},
  author = {Hamid Mohammadi and Seyed Hossein Khasteh},
  journal= {arXiv preprint arXiv:1810.06639},
  year   = {2020}
}

备注

15 pages, 4 figures, 4 tables, 7 equations