基于覆盖感知的 Web-知识-Web 管道用于面向特定领域的供应商发现
机器学习
2026-05-01 v4
摘要
识别特定行业领域中中小型企业(SME)的完整格局对于供应链韧性至关重要,但现有商业数据库存在显著的覆盖缺口——尤其是针对次级供应商和新兴细分市场的企业。我们提出了一种 Web-知识-Web(W→K→W)管道,通过迭代方式(1)爬取领域特定的 Web 资源以发现候选供应商实体,(2)使用领域适应的少样本 LLM 提示从而提取并整合结构化知识构建异构知识图谱,(3)利用知识图谱的拓扑结构和覆盖信号引导后续爬虫向供应商空间中未被充分代表的区域聚焦。为量化发现的完整性,我们引入一种覆盖估计框架,灵感来源于生态学种类丰富度估计器(Chao1、ACE),其针对 Web 实体人口进行了改造。针对半导体设备制造领域(NAICS 333242)的实验表明,W→K→W 管道在所有方法中实现了最高的精确率(0.165)和 F1 分数(0.123),同时仅使用 144 页——比 213 页的基线预算低 32%——构建了一个包含 664 个实体和 542 条关系的知识图谱,且 100% 的关系类型一致性。
引用
@article{arxiv.2602.24262,
title = {Coverage-Aware Web Crawling for Domain-Specific Supplier Discovery via a Web--Knowledge--Web Pipeline},
author = {Yijiashun Qi and Yijiazhen Qi and Tanmay Wagh},
journal= {arXiv preprint arXiv:2602.24262},
year = {2026}
}
备注
Accepted by 2026 7th International Conference on Computer Information and Big Data Applications