中文

ModelTables:关于模型的表格语料库

数据库 2025-12-19 v1 人工智能 信息检索

摘要

我们提出 ModelTables,一个捕获 Model Lake 中表格结构语义的基准数据集,弥补了仅靠文本检索常被忽视的表格语义。该语料库由 Hugging Face model cards、GitHub README 和引用论文构建,链接每张表格及其周围模型和出版物上下文。与开放数据湖表格相比,模型表格规模较小,但 exhibit 更密集的表格间关系,反映模型与基准演化的紧密耦合。当前版本覆盖超过 60K 个模型和 90K 张表格。为评估模型与表格相关性,我们构建了多源真实数据集,包含三个互补信号:(1) 论文引用链接,(2) 显式 model card 链接和继承,(3)共享训练数据集。我们提出一个广泛的实证用例用于基准,即表格搜索。我们比较经典数据湖搜索算子(可并集、可连接、关键词)和信息检索基线(稠密、稀疏、混合检索)在该基准上的表现。基于并集的语义表格检索在整体上达到 54.8% 的 P@1(引用信号为 54.6%,继承信号为 31.3%,共享数据集信号为 30.6%);基于表格的稠密检索达到 66.5% 的 P@1,元数据混合检索达到 54.1%。该评估表明在开发更佳表格搜索方法方仍有显著提升空间。通过发布 ModelTables 及其创建协议,我们提供首个大规模的人工智能模型结构化数据描述基准。我们对 Model Lake 中表格发现的用例,为开发更准确的语义检索、结构化比较以及原则化的结构化模型知识组织提供了直观与证据。源代码、数据及其他作品已在 https://github.com/RJMillerLab/ModelTables 上公开。

关键词

引用

@article{arxiv.2512.16106,
  title  = {ModelTables: A Corpus of Tables about Models},
  author = {Zhengyuan Dong and Victor Zhong and Renée J. Miller},
  journal= {arXiv preprint arXiv:2512.16106},
  year   = {2025}
}

备注

14 pages, 8 figures and 8 tables