中文

应对标注数据稀缺:使用 LLM 对 HTTP 流量中 PII 值的类别无关标注

人工智能 2026-05-08 v1 信息检索

摘要

对 Web 和移动应用程序的自动化隐私审计通常会分析出站 HTTP 流量,以检测个人身份信息(PII)泄露。然而,现有的基于学习的检测器通常依赖于稀缺的手动标注流量,并且与固定的标签分类体系紧密耦合,限制了跨领域和不断演变的 PII 定义的迁移能力。本文研究大型语言模型(LLM)能否在运行时提供分类体系的情况下,支持对 HTTP 消息体中显式传输的 PII 值进行类别无关标注。我们引入了一个基于 LLM 的多阶段流水线,该流水线结合了确定性预处理、标签级分类、针对性的实例级值标注以及输出验证。为了在不依赖敏感的真实用户捕获数据的情况下实现受控评估和基于示例的提示,我们进一步提出了一个基于 LLM 的生成器,用于生成带有手动验证的、分类体系衍生的 PII 标注的合成 HTTP 流量。我们在跨越不同 PII 领域和粒度级别的三个分类体系上评估了该方法。结果表明,该流水线能够准确检测 PII 类型并为具体的 PII 分类体系提取相应的值。总体而言,我们的发现将 LLM 定位为灵活的、类别无关的流量标注以及在不断演变的隐私分类体系下创建标注数据的有前景的基础。

关键词

引用

@article{arxiv.2605.06305,
  title  = {Addressing Labelled Data Scarcity: Taxonomy-Agnostic Annotation of PII Values in HTTP Traffic using LLMs},
  author = {Thomas Cory and Axel Küpper},
  journal= {arXiv preprint arXiv:2605.06305},
  year   = {2026}
}

备注

Accepted to 2026 IEEE European Symposium on Security and Privacy Workshops (EuroS&PW)