中文

双精炼循环学习:Mamba 及其在文本关联图上的社区检测的无监督文本分类

机器学习 2025-12-11 v2

摘要

预训练语言模型提供了强大的文本理解能力,但在实际应用中仍难以在无标签数据的情况下部署于文本关联网络。同时,社区检测方法通常忽略文本语义,限制了其在内容组织、推荐和风险监控等下游应用中的实用性。为克服这些限制,我们提出了双精炼循环学习(DRCL),一个完全无监督的框架,旨在适用于无标签或类别定义不可用的实际场景。DRCL 通过温暖启动初始化和 GCN 基社区检测模块(GCN-CDM)与文本语义建模模块(TSMM)之间的双向精炼循环集成结构和语义信息。两个模块不断交换伪标签,使语义线索能够增强结构聚类,同时结构模式能够指导文本表示学习,而无需人工监督。在多个文本关联图数据集上,DRCL 持续改善所发现社区的结构和语义质量。此外,仅凭 DRCL 的社区信号训练的 Mamba 基分类器,其准确率可与监督模型相当,展示了在标签数据稀缺或昂贵的大规模系统中部署的潜力。代码已公开于 https://github.com/wuanghoong/DRCL.git。

关键词

引用

@article{arxiv.2512.07100,
  title  = {Dual Refinement Cycle Learning: Unsupervised Text Classification of Mamba and Community Detection on Text Attributed Graph},
  author = {Hong Wang and Yinglong Zhang and Hanhan Guo and Xuewen Xia and Xing Xu},
  journal= {arXiv preprint arXiv:2512.07100},
  year   = {2025}
}