数据捕获器:化学与材料科学中的元数据、自动化与提取器互操作性
数据分析、统计与概率
2025-06-24 v2 材料科学
摘要
促进 FAIR 数据科学的两个关键问题是:数据提取器的发现性差以及使用这些工具(即从仪器创建的原始数据文件转换为可访问的元数据和科学洞察)的使用说明不一致。如果现有的格式转换工具难以发现、安装和使用,其重新实现将导致工作重复,维护负担也不可避免地增加。Datatractor 框架旨在解决上述问题。首先,通过提供一组经过精选的提取器工具,可提高其发现性。其次,通过采用标准化但轻量级的模式描述这些工具,可实现其安装和使用的机器可操作性。最后,我们提供了一个参考实现。Datatractor 框架可用于提供面向公众的数据提取服务,或整合到其他研究数据管理工具中,以提供额外的价值。
引用
@article{arxiv.2410.18839,
title = {Datatractor: Metadata, automation, and registries for extractor interoperability in the chemical and materials sciences},
author = {Matthew L. Evans and Gian-Marco Rignanese and David Elbert and Peter Kraus},
journal= {arXiv preprint arXiv:2410.18839},
year = {2025}
}
备注
(accepted version)