一种用于检测事故叙述中个人身份信息的智能体工作流
密码学与安全
2026-04-20 v1
摘要
事故报告中的事故叙述为交通安全分析提供了关键的背景信息。然而,由于其中包含个人身份信息(PII),如姓名、家庭住址和车牌号,其更广泛的使用受到阻碍。由于 PII 在事故叙述中稀疏且不一致地出现,人工检测无法扩展,而现有的基于规则的方法通常无法捕获依赖上下文的 PII。本研究利用大语言模型(LLM)开发并评估了一种可本地部署的、用于检测事故叙述中 PII 的智能体工作流。该工作流包含一个混合提取器和一个验证器。混合提取器将结构化 PII(如电话号码和电子邮件地址)路由到基于规则的模型(即 Presidio),并将依赖上下文的 PII(如姓名、家庭住址和字母数字标识符)路由到领域自适应、微调的 LLM。为了解决挑战性类别中的歧义,该工作流结合了集成 LLM 提取和一个通过基于证据的推理过滤错误检测的智能体验证步骤。在真实事故数据集上评估,该智能体工作流取得了优异的性能,精确率为 0.82,召回率为 0.94,F1 值为 0.87,准确率为 0.96,优于多种基线方法。此外,消融结果表明,集成 LLM 提取和验证器改进了对家庭住址和字母数字标识符的检测。该工作流在本地运行,支持限制外部 API 的隐私敏感操作环境。这项工作为可扩展、保护隐私的事故数据处理提供了一条实用且稳健的路径,在保护个人隐私的同时,使更广泛的研究和安全干预成为可能。
引用
@article{arxiv.2604.15369,
title = {An Agentic Workflow for Detecting Personally Identifiable Information in Crash Narratives},
author = {Junyi Ma and Pei Li and Rui Gan and Kai Cheng and Steven T. Parker and Bin Ran},
journal= {arXiv preprint arXiv:2604.15369},
year = {2026}
}
备注
13 pages, 5 figures