中文

短文本聚类的联邦学习

计算与语言 2023-12-14 v1 人工智能 信息检索

摘要

短文本聚类因其在从大量短文本中挖掘有价值洞察的重要性而广受研究。本文聚焦于联邦短文本聚类(FSTC)问题,即对不同客户端中分布的短文本进行聚类,这是在隐私要求下的一个现实问题。与短文本存储在中心服务器上的集中式短文本聚类问题相比,FSTC问题尚未被探索。为填补此空白,我们提出了联邦鲁棒短文本聚类(FSTC)框架。FSTC包含两个主要模块,即鲁棒短文本聚类模块和联邦聚类中心聚合模块。鲁棒短文本聚类模块旨在利用每个客户端的本地数据训练有效的短文本聚类模型。我们创新性地结合最优传输生成伪标签与高斯-均匀混合模型,以确保伪监督数据的可靠性。联邦聚类中心聚合模块旨在以高效方式跨客户端交换知识而不共享本地原始数据。服务器聚合来自不同客户端的本地聚类中心,并在每轮通信中将全局中心发回所有客户端。我们在三个短文本聚类数据集上的实证研究表明,FSTC显著优于联邦短文本聚类基线方法。

关键词

引用

@article{arxiv.2312.07556,
  title  = {Federated Learning for Short Text Clustering},
  author = {Mengling Hu and Chaochao Chen and Weiming Liu and Xinting Liao and Xiaolin Zheng},
  journal= {arXiv preprint arXiv:2312.07556},
  year   = {2023}
}