由聊天机器人生成的 150 万份材料叙述
材料科学
2023-08-29 v1 计算与语言
摘要
人工智能(AI)的出现使得针对各种应用对材料进行全面探索成为可能。然而,AI 模型往往优先关注科学文献中频繁出现的材料,限制了基于固有物理和化学性质筛选合适候选材料。为应对这种不平衡,我们基于 OQMD、Materials Project、JARVIS、COD 和 AFLOW2 数据库的组合生成了包含 1,494,017 个自然语言–材料段落的数据集,这些数据库以第一性原理计算为主,且在元素周期表上的分布趋于更均匀。生成文本叙述随后由人类专家与 ChatGPT-4 根据三项评分标准进行投票与打分:技术准确性、语言与结构、以及相关内容深度,结果显示评分相近,但人类打分的内容深度最为滞后。多模态数据源与大型语言模型(LLM)的融合,对于助力针对特定应用的固态材料探索与发现的 AI 框架具有巨大潜力。
引用
@article{arxiv.2308.13687,
title = {1.5 million materials narratives generated by chatbots},
author = {Yang Jeong Park and Sung Eun Jerng and Jin-Sung Park and Choah Kwon and Chia-Wei Hsu and Zhichu Ren and Sungroh Yoon and Ju Li},
journal= {arXiv preprint arXiv:2308.13687},
year = {2023}
}