不同文本嵌入对自然语言处理中聚类性能的影响
机器学习
2023-05-08 v1 计算与语言
信息检索
摘要
随着电子商务平台的出现,评论对于客户评估产品可信度至关重要。星级评分并不总是与顾客撰写的评论文本相符。例如,三星评分(满分五星)可能与评论文本不一致,后者可能更适合五星评论。可采用聚类方法将文本评论分组,从而重新标注正确的星级评分。在本工作中,我们探索了选择不同文本嵌入来表示这些评论的任务,并探讨了嵌入选择对各种聚类算法类别性能的影响。我们使用上下文(BERT)和非上下文(Word2Vec)文本嵌入来表示文本,并衡量它们对三类聚类算法的影响——基于划分的(KMeans)、单链接聚合层次聚类和基于密度的(DBSCAN 和 HDBSCAN),每类均设有多种实验设置。我们使用轮廓系数、调整兰德指数和聚类纯度指标来评估算法性能,并讨论不同嵌入对聚类性能的影响。我们的结果表明,所选嵌入类型会剧烈影响算法性能,不同聚类算法间的性能差异很大,没有哪种嵌入类型优于其他类型,且 DBSCAN 优于 KMeans 和单链接聚合聚类,但也将更多数据点标记为离群点。我们对不同算法的性能进行了全面比较,并提出了许多构想以促进文本聚类领域的进一步研究。
引用
@article{arxiv.2305.03144,
title = {Influence of various text embeddings on clustering performance in NLP},
author = {Rohan Saha},
journal= {arXiv preprint arXiv:2305.03144},
year = {2023}
}