中文

专利数据集:从专利中抓取氧化物玻璃成分与性能

数据库 2025-11-21 v1 材料科学

摘要

本文提出从专利表格中提取信息的网页抓取技术,用于清洗和结构化数据,以供未来用于预测性机器学习模型开发新玻璃。我们提取了成分和三个与新玻璃开发相关的性能指标,并将其结构化为数据库,可与来自其他可用数据集的信息一起使用。我们还分析了所获取信息的一致性以及它对现有数据库的贡献。提取的液相温度数据包括 5,696 种成分;第二个子集包含 4,298 个折射率;最后,1,771 种成分具有阿布纳数。此处所做的提取为液相温度提供约 10.4% 的新增信息,为折射率提供约 6.6% 的新增信息,为阿布纳数提供约 4.9% 的新增信息。影响超越数量:新提取的数据引入了比现有数据库中更具多样性的性能值,从而扩展了玻璃建模应用可达的组成空间和性能空间。我们强调,新数据库中成分的组成相对于现有基准包含更比例的钛酸盐、镁盐、锆盐、 niobium 盐、铁盐、锡盐和铱盐。

关键词

引用

@article{arxiv.2511.16366,
  title  = {From Patents to Dataset: Scraping for Oxide Glass Compositions and Properties},
  author = {Gustavo Laranja Thomaello and Thomaz Yeiden Busnardo Aguena and Eric Trevelato Costa and Rafael Baságlia Rosante and Thiago Rodrigo Ramos and Daiane Aparecida Zuanetti and Edgar Dutra Zanotto},
  journal= {arXiv preprint arXiv:2511.16366},
  year   = {2025}
}