面向可靠机器学习的数据集精选挑战:以热电材料为例
材料科学
2025-12-23 v1
摘要
驱动新型高效热电(TE)材料发现的机器学习方法需要大规模、多样且高质量的实验TE数据集。虽然最大的公开数据集Starrydata2拥有高数据量,但其包含大量因大型语言模型(LLM)辅助数据精选、文献中模糊命名和复杂材料公式的局限性导致的数据错误。另一未被充分解决的问题是包含来自多源实验数据,且标准偏差大且缺乏合成信息。以半-Heusler(hH)材料为例,本工作旨在首先指出这些错误和不一致之处,这些问题无法通过传统数据集精选工作流程进行过滤。随后,我们提出一种基于统计抽样误差的数据过滤方法,以解决上述问题,该方法可用于过滤其他材料属性的数据。最后,提出一种混合数据集创建工作流程,融合Starrydata2和手动提取的数据,分析并与Starrydata2进行比较。
引用
@article{arxiv.2512.18653,
title = {Tackling dataset curation challenges towards reliable machine learning: a case study on thermoelectric materials},
author = {Shoeb Athar and Adrien Mecibah and Philippe Jund},
journal= {arXiv preprint arXiv:2512.18653},
year = {2025}
}
备注
10 pages, 9 figures