基于三角损失的端到端微调方法用于有效 PII 检测中的网络嵌入
机器学习
2025-02-14 v1
摘要
移动数据生态系统中有许多方法通过检查在用户设备上运行的应用程序生成的网络流量来检测个人可识别信息 (PII) 的外泄。当前方法依赖于从 HTTP 请求中提取的特征,机器学习涉及在这些特征上训练分类器并使用标记的分组记录进行预测。然而,这些方法大多包含模型训练前的外部特征选择。深度学习则通常不需要此类技术,由于它能够在无需外部特征提取或选择算法的情况下自主学习和识别数据中的模式。本文提出一种基于深度学习的端到端学习框架,用于预测移动分组中 PII 暴露的风险。该框架采用预训练的大型语言模型 (LLM) 和自编码器生成网络分组的嵌入,然后使用基于三角损失的微调方法训练模型,通过两个真实世界数据集提高检测效果。我们将所提出的检测框架与其他当前工作进行比较,以检测用户设备上的 PII 漏泄。
引用
@article{arxiv.2502.09002,
title = {End-to-End triplet loss based fine-tuning for network embedding in effective PII detection},
author = {Rishika Kohli and Shaifu Gupta and Manoj Singh Gaur},
journal= {arXiv preprint arXiv:2502.09002},
year = {2025}
}
备注
13 pages, 10 figures, 5 tables