可重复性经验:来自材料科学中自然语言处理研究的启示
化学物理
2023-08-01 v1 人工智能
计算与语言
摘要
自然语言处理(NLP)作为人工智能的一个基石领域,已日益应用于材料科学文献研究中。本研究对域内两项开创性工作进行了可重复性分析:Kim 等人的“氧化物材料机器学习与编码合成参数”,以及 Tshitoyan 等人的“无监督词嵌入从材料科学文献中捕获潜在知识”。我们旨在从可重复性视角理解这些研究,承认它们对材料信息学领域的重大影响,而非批评它们。我们的研究表明,两篇论文都提供了详尽的工作流程、整洁且文档完备的代码库,以及清晰的模型评估指引。这使得成功复现其结果并部分复现其发现更为容易。在此过程中,它们为未来的材料科学出版物树立了值得效仿的标杆。然而,我们的分析也指出了可改进之处,例如:在版权限制允许的情况下提供训练数据访问权限、在模型架构与训练过程上更具透明度、以及明确软件依赖版本。我们还跨论文比较了词嵌入模型,发现可重复性与跨兼容性方面的一些关键差异可归因于模型本身边界之外的设计选择。总之,本研究赞赏这些开创性论文所设立的基准,同时倡导在材料科学 NLP 领域中进一步提升研究可重复性实践。这种理解与共进的平衡,终将推动 NLP 与材料科学文献的交叉领域迈向充满激动发现之未来。
引用
@article{arxiv.2307.15759,
title = {Lessons in Reproducibility: Insights from NLP Studies in Materials Science},
author = {Xiangyun Lei and Edward Kim and Viktoriia Baibakova and Shijing Sun},
journal= {arXiv preprint arXiv:2307.15759},
year = {2023}
}