基于语义与统计特征的越南语可读性评估研究
计算与语言
2024-11-08 v1
摘要
确定文本的难度涉及评估可能影响读者文本理解的各种文本特征,但目前越南语领域的研究仅关注统计特征。本文提出了一种整合统计方法和语义方法来评估文本可读性的新方法。我们的研究利用了三个不同的数据集:越南语文本可读性数据集(ViRead)、OneStopEnglish和RACE,后两个被翻译成越南语。先进的语义分析方法被用于语义方面,使用了最先进的语言模型,如PhoBERT、ViDeBERTa和ViBERT。此外,统计方法被用来提取文本的句法和词汇特征。我们使用各种机器学习模型进行了实验,包括支持向量机(SVM)、随机森林(Random Forest)和极端随机树(Extra Trees),并使用准确率和F1分数指标评估了它们的性能。我们的结果表明,结合语义和统计特征的联合方法显著提高了可读性分类的准确性,优于单独使用每种方法。本研究强调了同时考虑统计和语义方面对于更准确评估越南语文本难度的重要性。这一贡献为该领域提供了见解,并为该领域的未来研究奠定了基础。
引用
@article{arxiv.2411.04756,
title = {A study of Vietnamese readability assessing through semantic and statistical features},
author = {Hung Tuan Le and Long Truong To and Manh Trong Nguyen and Quyen Nguyen and Trong-Hop Do},
journal= {arXiv preprint arXiv:2411.04756},
year = {2024}
}