中文

基于领域的预处理对特定主题聚类的影响

机器学习 2020-11-17 v1 信息检索

摘要

全球新冠疫情导致大学多数教学突然转为线上,增加了学者们的工作量。其中一个因素是需回答大量学生查询。由于这些查询不限于讲座的同步时间段,其中许多高度相关甚至等价的可能性很大。应对此问题的一种方法是按主题对这些问题进行聚类。在我们先前的工作中,旨在寻找一种高效的改进聚类方法,使用了递归LDA模型。我们的数据集包含英国巴斯大学计算机科学课程中在线发布的问题。其中相当数量的问题含有代码片段,我们发现这造成了聚类问题,因为某些术语被当作英语常见词而非特定代码术语识别。为此,作为数据集预处理的一部分,我们使用Python对这些技术术语进行标注。本文探讨数据集标注的范畴,侧重于识别代码片段并提供实证结果以佐证我们的思路。

关键词

引用

@article{arxiv.2011.08127,
  title  = {The Influence of Domain-Based Preprocessing on Subject-Specific Clustering},
  author = {Alexandra Gkolia and Nikhil Fernandes and Nicolas Pizzo and James Davenport and Akshar Nair},
  journal= {arXiv preprint arXiv:2011.08127},
  year   = {2020}
}

备注

8 pages, 5 figures