中文

大型语言模型中药物学知识的追踪

计算与语言 2026-03-05 v1

摘要

大型语言模型(LLM)在药物学和药物发现任务中展现出强大的经验性能,但其内部如何编码药物学知识仍鲜有了解。本文利用因果分析和探针方法,探讨Llama系列生物医学语言模型中药物群语义的表示与检索方式。我们应用激活补丁技术在模型各层和token位置上局部化药物群信息的存储位置,并辅以在token级别和汇聚池化激活值上训练的线性探针进行分析。结果表明,早期层在编码药物群知识方面发挥关键作用,最强的因果效应来自药物群范围内的中间token,而非最终药物群token。线性探针进一步显示,药物学语义在token之间分布,且已存在于嵌入空间中,token级别探针接近随机水平,而汇聚表示实现最高准确率。综上,这些发现表明,LLM中的药物群语义并非局限于单个token,而是由分布式表示构成。本研究首次系统性地机制性分析了LLM中的药物学知识,为理解生物医学语义在大型语言模型中的编码方式提供了洞见。

关键词

引用

@article{arxiv.2603.03407,
  title  = {Tracing Pharmacological Knowledge In Large Language Models},
  author = {Basil Hasan Khwaja and Dylan Chen and Guntas Toor and Anastasiya Kuznetsova},
  journal= {arXiv preprint arXiv:2603.03407},
  year   = {2026}
}

备注

Accepted, Learning Meaningful Representations of Life (LMRL) Workshop @ ICLR 2026