预测多模态情境下的句子可接受性判断
数论
2026-05-28 v6
摘要
以往工作考察了深度神经网络 (DNN),尤其是 transformer,预测人类句子可接受性判断的能力,分别独立于情境,或在文档情境中。我们考察了人类和大语言模型 (LLM) 在面对视觉图像(即视觉情境)时,对这些判断的影响。我们的结果表明,与文本情境相比,视觉图像对人类的可接受性评分影响有限,若有则很小。然而,LLM 显示出在文档情境中人类判断看到的压缩效应。不同类型的 LLM 能够以高度准确的程度预测人类可接受性判断,但总体而言,在去除视觉情境后其性能略好。此外,LLM 判断的分布在模型之间存在差异,其中 Qwen 类似于人类模式,而其他模型则与之背离。LLM 生成的句子可接受性预测高度与其归一化对数概率相关,但在视觉情境存在时,相关性下降,这表明在视觉情境存在时,LLM 内部表征与其生成预测之间存在更大的差距。我们的实验工作表明,人类和 LLM 在多模态情境下的句子处理之间存在有趣的相似性与差异。
关键词
引用
@article{arxiv.2602.20917,
title = {Primes in arithmetic progressions to large moduli and refinements of Harman's sieve},
author = {Runbo Li},
journal= {arXiv preprint arXiv:2602.20917},
year = {2026}
}
备注
87 pages. Corrected an error in Section 2.5.2