视觉语言模型中情境依赖的 affordance 计算
摘要
我们刻画了视觉语言模型(VLMs)中情境依赖 affordance 计算的现象。通过规模为 n=3,213 个场景-情境对的大规模计算研究,使用 Qwen-VL 30B 和 LLaVA-1.5-13B,并在 7 个 agentic 人格之间进行系统性情境 priming,我们展示了大规模 affordance drift:在不同情境条件下的平均 Jaccard 相似度为 0.095 (95% 置信区间: [0.093, 0.096], p < 0.0001),表明超过 90% 的词汇化场景描述是情境依赖的。句子级余弦相似度确认了在语义层面存在显著的 drift(平均值为 0.415,58.5% 为情境依赖)。随机基线实验(在 4 个温度和 5 个随机种子下进行 2,384 次推理)确认了这种 drift 反映的是真实的情境效应而非生成噪声:在所有条件下,within-prime 方差显著低于 cross-prime 方差。 Tucker 分解配合 bootstrap 稳定性分析( n=1,000 次抽样)揭示了稳定的正交潜在因子:一个 "烹饪流形"局限于厨师情境,一个 "访问轴"跨越儿童- mobility 对比。这一发现确立了VLMs以相当程度的方式进行 affordance 计算——词汇(90%)与语义(58.5%)度量之间的差异反映了在情境变化下,表层词汇变化大于底层意义变化——并为机器人学研究指明了方向:而非静态世界建模,采用动态、查询依赖的本体投影(Just-In-Time Ontology)。我们不主张确立处理顺序或架构优先性;此类主张需要超出输出行为的内部表征分析。
引用
@article{arxiv.2603.04419,
title = {Context-Dependent Affordance Computation in Vision-Language Models},
author = {Murad Farzulla},
journal= {arXiv preprint arXiv:2603.04419},
year = {2026}
}
备注
31 pages, 8 tables, 4 figures, 43 references. Code available at: https://github.com/studiofarzulla/semantic-vision