基于联邦学习的隐私保护性仇恨语言识别
计算与语言
2024-04-18 v1 机器学习
摘要
各种形式的仇恨言语在线传播是社交媒体中的重要关注议题。虽然平台一直在投入大量资源来应对此问题,但隐私问题仍然未得到充分解决。用于检测社交媒体仇恨语言的模型通常在中心化服务器上进行训练和/或微调,涉及大量数据。由于大多数社交媒体数据来源于终端用户,我们提出一种基于联邦学习 (Federated Learning, FL) 的去中心化架构,用于在线识别仇恨语言。FL 是一种去中心化架构,允许在无需数据共享的情况下对多个模型进行本地训练,从而保护用户隐私。我们提出一种模型融合方法,用于执行联邦学习。我们在四个公开的英文基准数据集 (AHSD, HASOC, HateXplain, OLID) 上训练了多个深度学习模型,并详细评估了其性能。我们还呈现了初始的跨语言实验,涉及英文和西班牙语。我们表明,所提出的模型融合方法在所有数据集中均优于基线方法,同时能够保护隐私。
引用
@article{arxiv.2404.11470,
title = {A Federated Learning Approach to Privacy Preserving Offensive Language Identification},
author = {Marcos Zampieri and Damith Premasiri and Tharindu Ranasinghe},
journal= {arXiv preprint arXiv:2404.11470},
year = {2024}
}
备注
Accepted to TRAC 2024 (Fourth Workshop on Threat, Aggression and Cyberbullying) at LREC-COLING 2024 (The 2024 Joint International Conference on Computational Linguistics, Language Resources and Evaluation)