中文

基于对话模型的动态上下文学习用于数据提取和材料属性预测

材料科学 2024-08-06 v2 人工智能 计算物理

摘要

自然语言处理和大语言模型(LLMs)的出现彻底改变了从非结构化学术论文中提取数据的方式。然而,确保数据可信度仍然是一个重大挑战。本文介绍了PropertyExtractor,一个开源工具,它利用先进的对话式LLM(如Google gemini-pro和OpenAI gpt-4),将零样本与少样本上下文学习相结合,并采用工程化提示对结构化信息层次进行动态细化——实现自主、高效、可扩展且准确地识别、提取和验证材料属性数据。我们在材料数据上的测试表明,精确率和召回率超过95%,错误率约为9%,突显了该工具包的有效性和多功能性。最后,使用PropertyExtractor构建了二维材料厚度(器件集成的关键参数)和能带隙值的数据库。特别是对于厚度数据库,该领域的快速发展已经超越了实验测量和计算方法,造成了显著的数据缺口。我们的工作填补了这一缺口,并展示了PropertyExtractor作为自主生成各种材料属性数据库的可靠高效工具的潜力,推动了该领域的发展。

关键词

引用

@article{arxiv.2405.10448,
  title  = {Dynamic In-context Learning with Conversational Models for Data Extraction and Materials Property Prediction},
  author = {Chinedu Ekuma},
  journal= {arXiv preprint arXiv:2405.10448},
  year   = {2024}
}