中文

AI知道明年韩国高考会出现哪些单词

计算与语言 2023-08-04 v2

摘要

本文介绍了一种基于文本挖掘的单词类别分类方法和一种基于LSTM的词汇模式预测方法。首先描述了一种基于简单文本出现频率分析的预处理方法。该方法被开发为一种数据筛选工具,但其效果比先前的工作高出4.35至6.21倍。还提出了一种用于词汇出现模式预测的LSTM深度学习方法。AI利用以往考试的不同数据窗口大小进行回归,以预测单词在下次考试中出现的概率。AI在不同数据窗口上的预测值被处理成一个加权和的单一分数,我们称之为“AI-Score”,它代表了单词在明年考试中出现的概率。所提出的方法在100分区域显示出100%的准确率,在分数超过60分的区间内仅显示出1.7%的预测误差。所有源代码可在作者的Git Hub仓库免费获取。(https://github.com/needleworm/bigdata_voca)

关键词

引用

@article{arxiv.2211.15426,
  title  = {AI Knows Which Words Will Appear in Next Year's Korean CSAT},
  author = {Byunghyun Ban and Jejong Lee and Hyeonmok Hwang},
  journal= {arXiv preprint arXiv:2211.15426},
  year   = {2023}
}

备注

update additional experiment result