基于领域的预处理对特定主题聚类的影响
机器学习
2020-11-17 v1 信息检索
摘要
全球新冠疫情导致大学多数教学突然转为线上,增加了学者们的工作量。其中一个因素是需回答大量学生查询。由于这些查询不限于讲座的同步时间段,其中许多高度相关甚至等价的可能性很大。应对此问题的一种方法是按主题对这些问题进行聚类。在我们先前的工作中,旨在寻找一种高效的改进聚类方法,使用了递归LDA模型。我们的数据集包含英国巴斯大学计算机科学课程中在线发布的问题。其中相当数量的问题含有代码片段,我们发现这造成了聚类问题,因为某些术语被当作英语常见词而非特定代码术语识别。为此,作为数据集预处理的一部分,我们使用Python对这些技术术语进行标注。本文探讨数据集标注的范畴,侧重于识别代码片段并提供实证结果以佐证我们的思路。
引用
@article{arxiv.2011.08127,
title = {The Influence of Domain-Based Preprocessing on Subject-Specific Clustering},
author = {Alexandra Gkolia and Nikhil Fernandes and Nicolas Pizzo and James Davenport and Akshar Nair},
journal= {arXiv preprint arXiv:2011.08127},
year = {2020}
}
备注
8 pages, 5 figures