用于检测钓鱼网页的角色感知多模态联邦学习系统
机器学习
2025-10-17 v2 分布式、并行与集群计算
摘要
我们提出了一种联邦多模态钓鱼网页检测器,支持 URL、HTML 和 IMAGE 输入,且在推理时不将客户端绑定于固定模态:任何客户端均可调用在其他地方训练的任意模态头。在方法上,受 Mixture-of-Experts 和 FedMM 启发,我们在 FedProx 的基础上提出了角色感知分桶聚合。我们舍弃了可学习路由并采用硬门控(根据样本模态选择 IMAGE/HTML/URL 专家),从而实现对模态特定参数的分别聚合,以隔离跨嵌入冲突并稳定收敛。在 TR-OP 上,Fusion 头在两种数据类型上达到了 97.5% 的准确率(Acc)和 2.4% 的误报率(FPR);在图像子集(消融实验)上达到了 95.5% 的准确率和 5.9% 的误报率。对于文本,我们对 URL 使用 GraphCodeBERT,并对原始的含噪 HTML 使用早期三路嵌入。在 WebPhish(HTML)上我们获得了 96.5% 的准确率 / 1.8% 的误报率;在 TR-OP(原始 HTML)上获得了 95.1% 的准确率 / 4.6% 的误报率。结果表明,采用硬门控专家的分桶聚合能够在严格隐私下实现稳定的联邦训练,同时提升了多模态钓鱼检测的可用性与灵活性。
引用
@article{arxiv.2509.22369,
title = {Role-Aware Multi-modal federated learning system for detecting phishing webpages},
author = {Bo Wang and Imran Khan and Martin White and Natalia Beloff},
journal= {arXiv preprint arXiv:2509.22369},
year = {2025}
}
备注
22 pages, 9 figures