物理引导:物理基础模型中跨域概念的因果控制
机器学习
2025-12-01 v2 人工智能
计算物理
摘要
近期的机制可解释性进展表明,大型语言模型(LLM)内部的表示不仅对应具体实体,还对应于distinct的人类可理解抽象概念和行为。此外,这些隐藏特征可以被直接操控以引导模型行为。然而,是否属于这种现象是独特于在本质上结构化数据(即语言、图像)上训练的模型,还是基础模型的普遍属性,仍是一个未解决的问题。本文我们调查针对大型物理聚焦基础模型的内部表示。灵感来自最近识别 LLM 中复杂行为单一方向的工作,我们从模型在不同物理制度下的仿真数据集的前向传递中提取激活向量。随后计算“delta”表示 between 两个制度。这些 delta 张量在激活空间中充当概念方向,编码特定的物理特征。通过在推理期间将这些概念方向注入模型,我们可以引导其预测, demonstrating 对物理行为的因果控制,例如诱导或移除某种特定物理特征。这些结果表明,科学基础模型学习的是物理原理的通用表示。它们不仅仅依赖于仿真数据中的浅层相关性和模式。我们的发现为理解和控制科学基础模型开辟了新的途径,对 AI 启用科学发现具有启示意义。
引用
@article{arxiv.2511.20798,
title = {Physics Steering: Causal Control of Cross-Domain Concepts in a Physics Foundation Model},
author = {Rio Alexa Fear and Payel Mukhopadhyay and Michael McCabe and Alberto Bietti and Miles Cranmer},
journal= {arXiv preprint arXiv:2511.20798},
year = {2025}
}
备注
16 Pages, 9 Figures. Code available soon at https://github.com/DJ-Fear/walrus_steering