显微镜下:解读菲律宾语可读性评估模型
计算与语言
2021-10-04 v1 机器学习
摘要
可读性评估是识别某文本对其目标受众而言的易读或难读程度的过程。相关方法已从算术公式的使用演进到使用机器学习算法训练的更复杂模式识别模型。尽管这些方法取得了有竞争力的结果,但在定量分析语言变量如何影响模型推断方面的工作有限。本工作中,我们通过全局与局部模型解释来剖析基于机器学习的菲律宾语可读性评估模型,以理解不同语言特征的贡献,并讨论其在菲律宾语语境下的含义。结果显示,使用由全局解释选出 top 特征训练的模型比使用由 Spearman 相关选出的特征的模型性能更高。同样,我们还在经验上观察到了用于区分阅读难度的极细粒度局部特征权重边界,以及其值受扰动时的相应影响。
引用
@article{arxiv.2110.00157,
title = {Under the Microscope: Interpreting Readability Assessment Models for Filipino},
author = {Joseph Marvin Imperial and Ethel Ong},
journal= {arXiv preprint arXiv:2110.00157},
year = {2021}
}
备注
Accepted for oral presentation at PACLIC 2021