利用深度学习技术预测竞技编程题目的标签
计算与语言
2023-08-04 v1
摘要
在过去十年中,机器学习与深度学习领域(主要集中于自然语言处理(NLP)领域)的研究数量急剧上升。竞技编程是一种广受欢迎的、用于培养逻辑构建与问题解决等编程能力的方法。由于可获取的题量巨大且主题、难度与题目类型多样,新手乃至资深程序员都难以在海量题库中导航。为了帮助程序员找到契合其知识与兴趣的题目,亟需一种自动化方法。这可通过利用文本分类对题目进行自动标注来实现。文本分类是 NLP 领域中广泛研究的重要任务之一。在本文中,我们提出了一种利用文本分类技术判定竞技编程题目所属领域的方法。我们实现了多种模型,包括 LSTM、GRU 和 MLP。数据集抓取自大型竞技编程网站 Codeforces。我们共抓取并预处理了 2400 道题目,将其用作模型训练与测试的 dataset。我们的模型所达到的最高准确率为 78.0%,由 MLP(多层感知机)取得。
引用
@article{arxiv.2308.01862,
title = {Wider and Deeper LLM Networks are Fairer LLM Evaluators},
author = {Xinghua Zhang and Bowen Yu and Haiyang Yu and Yangyu Lv and Tingwen Liu and Fei Huang and Hongbo Xu and Yongbin Li},
journal= {arXiv preprint arXiv:2308.01862},
year = {2023}
}
备注
Work in Progress