中文

面向人类认知:视觉上下文指导语法化先兆在融合编码模型中的表现

计算与语言 2025-10-20 v2

摘要

结构化先兆现象指出,接触特定语法结构后,人类倾向于在后续言语中产生相同结构。虽然人类在各种语言情境中一致显示出结构化先兆效应,但多模态大语言模型 (MLLM) 是否表现出类似的语法保留行为尚不明了。我们引入 PRISMATIC,这是第一个面向多模态结构化先兆的数据集,它为计算语言学提供了标准化基准,以检验语法-视觉相互作用。我们提出了语法保留指数 (Syntactic Preservation Index, SPI),这是一种专为评估句子层面结构化先兆效应而设计的新型无参考评估指标。通过该指标,我们构建并测试了两种不同的多模态编码架构的模型,以探究其结构化保留能力。我们的实验结果表明,两种编码方法的模型均表现出相当的语法化先兆效应。然而,只有融合编码模型显示出先兆效应与视觉相似性之间的稳健正相关,表明其认知过程更贴近人类心理语言学模式。本工作为评估和理解多模态语言模型中语法信息的处理提供了新的见解。

关键词

引用

@article{arxiv.2502.17669,
  title  = {Towards Human Cognition: Visual Context Guides Syntactic Priming in Fusion-Encoded Models},
  author = {Bushi Xiao and Michael Bennie and Jayetri Bardhan and Daisy Zhe Wang},
  journal= {arXiv preprint arXiv:2502.17669},
  year   = {2025}
}