中文

一种预测印地语推文中 Emoji 的联邦学习方法

机器学习 2022-11-14 v1 计算与语言

摘要

Emoji 的使用为通常具有私密性的文本交流提供了一种视觉模态。然而,预测 Emoji 的任务对机器学习构成了挑战,因为 Emoji 的使用往往聚集为频繁使用的 Emoji 和极少使用的 Emoji。关于 Emoji 使用的机器学习研究大多集中于高资源语言,并围绕传统的服务端机器学习方法来构建预测 Emoji 的任务。然而,用于私密通信的传统机器学习方法可能会引发隐私担忧,因为这些方法要求将所有数据传输至中央存储。在本文中,我们旨在解决偏重高资源语言进行 Emoji 预测与危及人们数据隐私这两个双重问题。我们引入了一个包含 118118k 条推文(由 2525k 条独立推文增强而来)的印地语 Emoji 预测新数据集,并提出对联邦学习算法 CausalFedGSD 的修改,旨在在模型性能与用户隐私之间取得平衡。我们表明,我们的方法在与更复杂的集中式模型获得相当分数的同时,减少了优化模型所需的数据量,并最大程度地降低了用户隐私风险。

关键词

引用

@article{arxiv.2211.06401,
  title  = {A Federated Approach to Predicting Emojis in Hindi Tweets},
  author = {Deep Gandhi and Jash Mehta and Nirali Parekh and Karan Waghela and Lynette D'Mello and Zeerak Talat},
  journal= {arXiv preprint arXiv:2211.06401},
  year   = {2022}
}

备注

EMNLP2022 Main Track Short Paper