基于 Foundation Models 的燃烧科学可靠知识处理框架
人工智能
2024-09-12 v2 机器学习
摘要
本研究探讨了将大语言模型(LLM)整合到科学数据同化中,以燃烧科学作为案例研究。利用与检索增强生成(RAG)框架集成的基础模型,该研究引入了一种处理多样化燃烧研究数据的方法,涵盖实验研究、模拟和文献。燃烧研究的多面性强调了知识处理在从海量且多样化的来源中导航和提取有价值信息方面的关键作用。所开发的方法在优化数据隐私和准确性的同时,最大限度地减少了计算和经济开销。它结合了提示工程和离线开源 LLM,为用户提供了选择基础模型的自主权。该研究对文本分割策略进行了全面检查,对 LLM 进行了比较研究,并探索了各种优化的提示以展示该框架的有效性。通过引入外部数据库,该框架在生成准确响应和构建稳健论证方面优于传统 LLM。此外,该研究还深入探讨了用于高效提取科学文献的优化提示模板。该研究通过引入结合检测算法开发的自定义工作流来过滤不准确之处,解决了与幻觉和虚假研究文章相关的问题。尽管存在需要改进的领域,该框架在最少的人工监督下始终提供准确的特定领域响应。所引入的提示无关方法为未来的研究提供了前景。该研究强调了在科学研究中整合 LLM 和知识处理技术的重要性,为数据同化和利用的进步奠定了基础。
引用
@article{arxiv.2401.00544,
title = {A Reliable Knowledge Processing Framework for Combustion Science using Foundation Models},
author = {Vansh Sharma and Venkat Raman},
journal= {arXiv preprint arXiv:2401.00544},
year = {2024}
}
备注
38 pages and 10 figures; Fixed figure resolution