多模态大语言模型在简单指代消解任务中是否是语用能力合格的倾听者?
计算与语言
2025-11-04 v1
摘要
我们研究了多模态大语言模型在指代消解任务中的语言能力,这些任务具有简单但抽象的视觉刺激,如色块和颜色网格。尽管该任务对当今的语言模型来说似乎并不具有挑战性,对人类二人组而言也较为直接,但我们认为它是对 MLLMs 语用能力的高度相关探测。我们的结果和分析确实表明,基本的语用能力,如对颜色描述的上下文相关解释,仍然是最先进的 MLLMs 面临的主要挑战。
引用
@article{arxiv.2506.11807,
title = {Are Multimodal Large Language Models Pragmatically Competent Listeners in Simple Reference Resolution Tasks?},
author = {Simeon Junker and Manar Ali and Larissa Koch and Sina Zarrieß and Hendrik Buschmeier},
journal= {arXiv preprint arXiv:2506.11807},
year = {2025}
}
备注
To appear in ACL Findings 2025