中文

基于联邦学习的清洁与攻击场景下多语言表情符号预测

计算与语言 2023-07-10 v3

摘要

联邦学习因其去中心化与隐私保护的设计,在机器学习领域日益受到关注。联邦学习中的模型训练分布在多个客户端上,在保持隐私的同时可访问大量客户端数据。随后,服务器在这些多个客户端上聚合训练结果而无需访问其数据,这些数据可以是任何社交媒体服务和即时通讯平台中广泛用来表达用户情感的表情符号。本文提出了在清洁与攻击两种场景下基于联邦学习的多语言表情符号预测。表情符号预测数据已从 Twitter 与 SemEval 表情符号数据集中爬取。该数据用于训练并评估不同规模的 transformer 模型,包括稀疏激活的 transformer,假设条件为所有客户端数据清洁,或某些客户端通过标签翻转攻击投毒。在这些模型上的实验结果表明,在不同数据源与分布下,联邦学习在清洁或受攻击场景中的表现与集中式训练在多语言表情符号预测中对已知与未知语言的表现相近。除联邦学习的隐私与分布式优势外,我们训练的 transformer 在 SemEval 表情符号数据集上的表现优于其他技术。

关键词

引用

@article{arxiv.2304.01005,
  title  = {Federated Learning Based Multilingual Emoji Prediction In Clean and Attack Scenarios},
  author = {Karim Gamal and Ahmed Gaber and Hossam Amer},
  journal= {arXiv preprint arXiv:2304.01005},
  year   = {2023}
}

备注

5 pages, 1 figure, conference