中文

面向政治传记提取的智能体框架

计算与语言 2026-03-20 v1 人工智能 计算机与社会

摘要

大规模政治数据集的生产通常需要从大量非结构化文档或网络来源中提取结构化事实,这一任务传统上依赖昂贵的人类专家,且难以在规模上实现自动化。在本文中,我们利用大型语言模型(LLM)自动化提取多维度的精英传记,以解决政治科学研究中的长期瓶颈。我们提出一种两阶段“综合-编码”框架,用于处理复杂提取任务:上游综合阶段使用递归智能体 LLM 搜索、筛选和精选来自异构网络来源的传记资料,随后在下游编码阶段将精选的传记资料映射到结构化数据框中。我们通过三个主要结果进行验证。首先,我们展示在给定精选上下文时,LLM 编码器在提取准确率上可匹配或超越人类专家。其次,我们表明在网络环境中,智能体系统从网络资源中综合出的资料信息超过人类集体智慧(如维基百科)。最后,我们诊断出直接从长篇多语言语料库进行编码会引入偏见,而综合阶段通过将证据浓缩为信号密集型表征可缓解此问题。通过全面评估,我们提供了一个通用、可扩展的框架,用于构建透明且可扩张的政治科学大型数据库。

关键词

引用

@article{arxiv.2603.18010,
  title  = {Agentic Framework for Political Biography Extraction},
  author = {Yifei Zhu and Songpo Yang and Jiangnan Zhu and Junyan Jiang},
  journal= {arXiv preprint arXiv:2603.18010},
  year   = {2026}
}

备注

70 pages, 14 figures