中文

基于摘要的供应链发现与 LLM:扩展中国市场的可见性

社会与信息网络 2026-05-28 v1 人工智能 物理与社会

摘要

金融和经济研究通常依赖于结构化的供应链披露和商业数据库。在中国,供应商-客户披露通常仅限于上市公司的重大合作伙伴,导致非上市公司和长尾企业间联系在结构化数据中记录不足。公共网络证据可以通过企业、政府和贸易媒体的披露部分弥补这一空白;然而,大规模的全文网络挖掘成本高昂,因为页面通常难以访问或使用大型语言模型(LLM)处理成本过高。我们提出了一种基于摘要的方法来构建供应链知识图谱(SCKG),以企业为节点,企业间关系为边。网络搜索摘要是随搜索结果返回的、偏向查询的摘要。我们将其用作基于 LLM 的关系提取的可扩展第一层证据。我们从提取效率和覆盖范围两方面评估了该流程。在提取效率方面,穷举式全文分块发现的关系数量是摘要的 19.8 倍,但需要的输入 token 数量是后者的 251.2 倍,且冗余度更高。在覆盖范围方面,我们使用 130,685 家中国企业作为搜索种子,涵盖截至 2024 年的上海/深圳上市公司和大型非上市公司。在上市公司子集中,生成的 SCKG 覆盖的企业数量是 CSMAR 披露基准的 7.2 倍,关系数量是后者的 9.3 倍,同时揭示了重尾度分布模式。保留的来源元数据使 SCKG 成为基于披露的数据库的可审计补充。

关键词

引用

@article{arxiv.2605.27845,
  title  = {Snippet-Driven Supply Chain Discovery with LLMs: Scaling Visibility in China},
  author = {Hiroto Fukada and Takayuki Mizuno},
  journal= {arXiv preprint arXiv:2605.27845},
  year   = {2026}
}

备注

8 pages, 4 figures, 3 tables