中文

多模态大语言模型中的量化与对象感知

计算与语言 2026-03-26 v2

摘要

量化已被证明是 (多模态) 大语言模型 (MLLM) 中最具挑战性的语言现象之一。然而,鉴于量化与逻辑、语用和数值领域相互交织,导致其表现不佳的具体原因仍不明确。本文考察了人类量化跨语言共享的三个关键特征,这些特征在 (M)LLM 文献中尚未被探讨:量化在尺度上的排序、使用范围和原型性,以及人类近似数量系统中固有的偏见。旨在确定这些特征在模型架构中的编码方式、它们与人类的差异,以及结果是否受模型类型(思考型 vs. 指令型)和所研究语言的影响。结果表明,尽管思考型模型在数感估计任务中和量化在尺度上的组织方面表现出高准确率,但在使用范围和原型性价值方面仍存在人类与 LLM 之间的关键差异。该工作为探讨 MLLM 作为语义和语用主体的本质,同时通过跨语言视角可以阐明其能力在不同语言中的稳健性和稳定性。

关键词

引用

@article{arxiv.2511.08126,
  title  = {Quantification and object perception in Multimodal Large Language Models and human linguistic cognition},
  author = {Raquel Montero and Natalia Moskvina and Paolo Morosi and Tamara Serrano and Elena Pagliarini and Evelina Leivada},
  journal= {arXiv preprint arXiv:2511.08126},
  year   = {2026}
}