中文

PersonaFingerprint:利用 LLM 驱动的浏览测量现代网站上的用户画像推断

密码学与安全 2026-05-18 v1

摘要

网站指纹识别(WFP)传统上侧重于从加密流量元数据(如数据包大小和时间)推断用户访问了哪个网站。在本文中,我们识别并量化了现代网络环境中的一种新隐私风险:攻击者仅使用数据包长度和到达间隔时间序列就能推断出用户的用户画像。为了大规模研究这种风险,我们构建了一个 LLM 驱动的多智能体浏览框架,该框架在计算机使用智能体与真实网站交互并收集相应加密流量轨迹时,强制执行可控的用户画像约束。我们将用户画像指纹识别形式化为闭集和开放世界两种设定,并进一步评估用户画像信息是否已嵌入现有 WFP 模型学到的表征中,以及能否以低成本进行放大。在 10 个现代网站和 15 种用户画像(外加一个开放世界类别)上,用户画像推断在混合站点流量上达到了约 84% 的准确率;此外,一个轻量级的多任务目标可以将用户画像准确率提升至约 80%,同时保持强大的站点分类性能(约 93% 的基线)。我们的结果表明,在现代网站上,加密流量元数据不仅可能泄露用户访问了哪个站点,还可能泄露他们如何浏览以及谁在浏览。

关键词

引用

@article{arxiv.2605.15962,
  title  = {PersonaFingerprint: Measuring Persona Inference on Modern Websites with LLM-Driven Browsing},
  author = {Chuxu Song and Hao Wang and Richard Martin},
  journal= {arXiv preprint arXiv:2605.15962},
  year   = {2026}
}