中文

COVID-19 推文语义聚类中迁移学习与距离度量的比较研究

计算与语言 2021-11-17 v1 机器学习

摘要

本文是在 COVID-19 数据主题检测背景下的一项比较研究。主题检测有诸多方法,本文选取了聚类方法。聚类需要距离,而计算距离需要嵌入。本研究旨在同时考察嵌入方法、距离度量与聚类方法这三个因素及其交互作用。使用的数据集为通过 COVID-19 相关标签收集的一个月推文。在嵌入方法中选取了从早期到新颖的五种方法:Word2Vec、fastText、GloVe、BERT 和 T5。本文考察了五种聚类方法:k-means、DBSCAN、OPTICS、谱聚类和 Jarvis-Patrick。还检验了该领域最重要的两种距离度量——欧氏距离与余弦距离。首先,执行了超过 7500 次测试以调参。随后,通过轮廓系数考察了嵌入方法、距离度量与聚类方法的所有不同组合。这些组合共 50 种情况。首先,考察了这 50 次测试的结果。然后,考虑了每种方法在所有该方法测试中的排名。最后,分别研究了研究的主要变量(嵌入方法、距离度量和聚类方法)。对控制变量取平均以抵消其影响。实验结果表明,就轮廓系数而言,T5 大幅优于其他嵌入方法。在距离度量方面,余弦距离略优。就聚类方法而言,DBSCAN 也优于其他方法。

关键词

引用

@article{arxiv.2111.08658,
  title  = {A Comparative Study on Transfer Learning and Distance Metrics in Semantic Clustering over the COVID-19 Tweets},
  author = {Elnaz Zafarani-Moattar and Mohammad Reza Kangavari and Amir Masoud Rahmani},
  journal= {arXiv preprint arXiv:2111.08658},
  year   = {2021}
}