基础模型是否懂得几何?探测冻结特征用于连续物理测量
计算机视觉与模式识别
2026-03-09 v1 人工智能
摘要
视觉语言模型编码连续几何而其文本路径无法表达:6000 维参数的线性探针从冻结特征中提取关节角度,MAE 为 6.1 度,而最佳文本输出仅为 20.0 度——瓶颈为 3.3 倍。LoRA 微调(r=16,2000 张图片)将瓶颈缩小至 6.5 度,提供了功能性收敛而非表征性收敛的证据。训练目标对准确性影响大于架构:五种编码器横跨自监督、对比和混合范式,在共享最少 CKA=0.41 表征相似性的情况下收敛至统计等效准确性(R^2≈0.55,TOST 在 delta=0.03 等价)。自回归生成损害几何保真度,但损害源于生成过程而非语言对齐:Qwen2.5-VL 的 LLM 层实际上提高了原始视觉编码器的探针准确性。层级分析揭示所有架构均存在普遍的中网络准确性峰值,注意力头在第 18-22 层携带比例的几何信号。这些发现使单个冻结 backbone 能够通过轻量级探针作为多任务几何传感器工作,无需微调或文本生成。
引用
@article{arxiv.2603.06459,
title = {Do Foundation Models Know Geometry? Probing Frozen Features for Continuous Physical Measurement},
author = {Yakov Pyotr Shkolnikov},
journal= {arXiv preprint arXiv:2603.06459},
year = {2026}
}