中文

从残差到原因:基于 LLM 的表格数据机制推断

机器学习 2026-05-25 v1

摘要

机器学习在科学应用中持续面临的挑战是同时实现预测与理解。统计模型在结构化数据上表现出色,但作为黑箱运作;而现有的可解释性方法大多为被动检查:它们回答“哪些特征重要?”但无法阐述特征如何相互作用或在人类理解的过程中不断细化解释。我们不直接要求 LLM 进行预测,而是以基线模型为锚点,询问 LLM 该模型遗漏了什么。我们引入 Multi-Agent Residual In-Context Learning (MARICL),一种代理框架,其中 LLM 代理分析基线模型的失效点,假设从高残差示例中推断缺失的结构,并通过多轮文本梯度优化产生明确的校正项。跨越九个基准(涵盖科学、医疗、社会经济和合成场景)的实验显示,MARICL 在所有数据集上均优于其基线模型。为了检验这些校正项是否反映真实结构还是特定批次的噪声,我们冻结在 Cell-Free Protein 数据集的一个实验批次上学习的公式,并应用于 held-out 批次(无需重新训练和进一步的 LLM 调用)。在相同的试剂方案下,这些冻结公式在超过 92% 的情况下改进了预测;在不同的方案下,则系统性地失败。成功边界与生物化学相关,而非批次数量;这提供了机制性泛化的直接证据。

关键词

引用

@article{arxiv.2605.22897,
  title  = {From Residuals to Reasons: LLM-Guided Mechanism Inference from Tabular Data},
  author = {Mohammad R. Rezaei and Rahul G. Krishnan},
  journal= {arXiv preprint arXiv:2605.22897},
  year   = {2026}
}