大型语言模型用于纳米合成机理解释:坚实的基础还是空洞的推论?
机器学习
2024-07-15 v1
摘要
随着人工智能(AI)的快速发展,大型语言模型(LLM)如GPT-4在科学界引起广泛关注,显示出推动科学发现的巨大潜力。这一进展引出一个关键问题:这些LLM是否与现实的物理化学原理相匹配?当前的评估策略主要强调基于事实的知识,如材料性质预测或名称识别,但往往缺乏对需要逻辑推理的基本物理化学机理的理解。为弥合这一差距,我们的研究开发了一个由775个关于金纳米颗粒合成机理的多选题组成的基准测试。通过反思现有评估指标,我们质疑直接的真假评估是否仅仅表明推论。因此,我们提出了一种新型评估指标,即基于置信度的得分(c-score),该指标探测输出logit以推导正确答案的精确概率。在大量实验结果表明,在金纳米颗粒合成的语境下,LLM理解其背后的物理化学机理而非依赖空洞推论。该研究凸显了LLM把握内在科学机理的潜力,为开发更可靠和有效的AI工具在各种科学领域奠定了基础。
引用
@article{arxiv.2407.08922,
title = {Leveraging large language models for nano synthesis mechanism explanation: solid foundations or mere conjectures?},
author = {Yingming Pu and Liping Huang and Tao Lin and Hongyu Chen},
journal= {arXiv preprint arXiv:2407.08922},
year = {2024}
}