AI知道明年韩国高考会出现哪些单词
计算与语言
2023-08-04 v2
摘要
本文介绍了一种基于文本挖掘的单词类别分类方法和一种基于LSTM的词汇模式预测方法。首先描述了一种基于简单文本出现频率分析的预处理方法。该方法被开发为一种数据筛选工具,但其效果比先前的工作高出4.35至6.21倍。还提出了一种用于词汇出现模式预测的LSTM深度学习方法。AI利用以往考试的不同数据窗口大小进行回归,以预测单词在下次考试中出现的概率。AI在不同数据窗口上的预测值被处理成一个加权和的单一分数,我们称之为“AI-Score”,它代表了单词在明年考试中出现的概率。所提出的方法在100分区域显示出100%的准确率,在分数超过60分的区间内仅显示出1.7%的预测误差。所有源代码可在作者的Git Hub仓库免费获取。(https://github.com/needleworm/bigdata_voca)
引用
@article{arxiv.2211.15426,
title = {AI Knows Which Words Will Appear in Next Year's Korean CSAT},
author = {Byunghyun Ban and Jejong Lee and Hyeonmok Hwang},
journal= {arXiv preprint arXiv:2211.15426},
year = {2023}
}
备注
update additional experiment result