基于LLM的模式导向缺失人口情报从异构数据源中提取与验证
计算与语言
2026-04-09 v1 人工智能
信息检索
机器学习
摘要
失踪人口和儿童安全调查依赖于包含结构化表格、公告式帖子和叙事性网页轮廓等异构案件文档。布局、术语和数据质量的差异阻碍了快速分诊、大规模分析和搜索计划工作流程。本文引入Guardian Parser Pack,一种AI驱动的解析和归一化管道,将多源调查文件转换为统一且模式合规的表示,适用于操作审查和下游空间建模。该系统集成了(i)多引擎PDF文本提取,配合光学字符识别(OCR)后备方案;(ii)基于规则的来源识别与特定来源的解析器;(iii)模式优先的归一化与验证;(iv)可选的大语言模型(LLM)辅助提取路径,包含验证器引导的修复和共享地理编码服务。我们呈现系统架构、关键实现决策和输出设计,并使用金标准对齐提取指标和语料库层面的操作指标进行评估。在75个案例的手动对齐子集上,LLM辅助路径的提取质量显著高于确定性比较器(F1 = 0.8664 vs. 0.2578),而在517个解析记录中,两个路径的关键字段完整性也有所提升(96.97% vs. 93.23%)。确定性路径仍远快于LLM路径(平均运行时间0.03秒/记录 vs. LLM路径的3.95秒/记录)。在评估运行中,所有LLM输出均通过初始模式验证,因此验证器引导的修复功能作为内置安全措施发挥作用,而非对观察到的提升贡献。这些结果支持在模式优先、可审计的管道中对概率AI进行受控使用,以适应高风险调查环境。
引用
@article{arxiv.2604.06571,
title = {LLM-based Schema-Guided Extraction and Validation of Missing-Person Intelligence from Heterogeneous Data Sources},
author = {Joshua Castillo and Ravi Mukkamala},
journal= {arXiv preprint arXiv:2604.06571},
year = {2026}
}
备注
9 pages, 6 figures. Accepted at International Conference on Intelligent Digitization of Systems and Services (IDSS 2026)