中文

基于混合主题-语义标签与图嵌入的无监督法律文档聚类

机器学习 2025-09-03 v1 计算与语言 机器学习

摘要

法律文档在文本分类中具有独特挑战,主要due to其领域特定语言以及常常有限的标记数据。本文提出一种混合方法,用于通过结合无监督主题与图嵌入来实现法律文本分类。我们采用Top2Vec学习语义文档嵌入并自动发现潜在主题,同时使用Node2Vec通过法律文档的二分图捕获结构关系。将这些嵌入组合后使用KMeans进行聚类,得到连贯的文档分组。我们对法律文档数据集上的计算结果表明,结合Top2Vec+Node2Vec的方法在文本唯一或图唯一嵌入的聚类质量上均显著优于单一方法。我们对超参数进行了敏感性分析,如聚类数量和嵌入维度,并演示了该方法在针对Latent Dirichlet Allocation(LDA)和非负矩阵分解(NMF)基线模型方面达到竞争性性能。关键发现表明,尽管该管道通过结合语义主题建模与图嵌入技术提供了创新的无监督法律文档分析方法,但其有效性取决于初始主题生成的质量以及所选嵌入模型为特殊法律语言所具有的表征能力。战略性建议包括探索领域特定嵌入、对Node2Vec进行更全面的超参数调优、动态确定聚类数量以及建立稳健的人类在环验证流程,以提升法律相关性和可信度。该管道演示了其在探索性法律数据分析中以及作为监督学习任务的前导器具有潜力,但需要进一步的精炼和领域特定适应才能用于实际法律应用。

关键词

引用

@article{arxiv.2509.00990,
  title  = {Hybrid Topic-Semantic Labeling and Graph Embeddings for Unsupervised Legal Document Clustering},
  author = {Deepak Bastola and Woohyeok Choi},
  journal= {arXiv preprint arXiv:2509.00990},
  year   = {2025}
}

备注

20 pages, 8 figures, 3 tables