基于互信息的短文本主题建模联邦非负矩阵分解
计算与语言
2022-05-27 v1 人工智能
机器学习
摘要
基于非负矩阵分解(NMF)的主题建模广泛用于自然语言处理(NLP)中以揭示短文本文档的隐藏主题。通常,训练高质量主题模型需要大量文本数据。在许多现实场景中,客户文本数据应是私有且敏感的,无法上传至数据中心。本文提出一种联邦NMF(FedNMF)框架,允许多个客户端利用本地存储的数据协作训练基于NMF的高质量主题模型。然而,当客户端间数据分布异构时,标准联邦学习会显著削弱主题模型在下游任务(例如文本分类)中的性能。为缓解此问题,我们进一步提出FedNMF+MI,其同时最大化本地文本的计数特征与其主题权重向量之间的互信息(MI),以减轻性能退化。实验结果表明,在一致性分数和分类F1分数上,我们的FedNMF+MI方法以显著优势超越联邦潜在狄利克雷分配(FedLDA)和不带MI的FedNMF方法。
引用
@article{arxiv.2205.13300,
title = {Federated Non-negative Matrix Factorization for Short Texts Topic Modeling with Mutual Information},
author = {Shijing Si and Jianzong Wang and Ruiyi Zhang and Qinliang Su and Jing Xiao},
journal= {arXiv preprint arXiv:2205.13300},
year = {2022}
}
备注
7 pages, 4 figures, accepted by IJCNN 2022