AMGPT:用于增材制造中上下文查询的大型语言模型
计算与语言
2024-06-04 v1 机器学习
摘要
通用的大型语言模型(如GPT-4)可能无法为材料科学研究人员提出的查询提供具体答案。这些模型可能会生成一个高层次的概述,但缺乏返回关于新型合金的制造和材料特性的详细说明的能力。用专门的领域知识增强一个较小的模型,可能比无法快速重新训练以跟上金属增材制造(AM)研究快速步伐的大型语言模型更具优势。我们引入了“AMGPT”,一个专门为金属AM查询设计的专用LLM文本生成器。AMGPT的目标是帮助研究人员和用户浏览AM领域的大量文献。我们没有从头开始训练,而是在检索增强生成(RAG)设置中使用了Hugging Face的预训练Llama2-7B模型,利用它动态整合来自约50篇AM论文和PDF格式教科书的信息。使用Mathpix将这些PDF文档转换为TeX格式,便于将它们集成到由LlamaIndex管理的RAG管道中。该项目的专家评估强调,来自RAG设置的特定嵌入加速了响应时间,并保持了生成文本的连贯性。
引用
@article{arxiv.2406.00031,
title = {AMGPT: a Large Language Model for Contextual Querying in Additive Manufacturing},
author = {Achuth Chandrasekhar and Jonathan Chan and Francis Ogoke and Olabode Ajenifujah and Amir Barati Farimani},
journal= {arXiv preprint arXiv:2406.00031},
year = {2024}
}
备注
54 pages, 4 figures