DixitWorld:通过多智能体Dixit游戏评估视觉语言模型中的多模态溯因推理
人工智能
2025-10-14 v1
摘要
多模态溯因推理——从部分观察中生成和选择解释性假设——是智能的基石。目前对视觉语言模型(VLM)中这种能力的评估主要局限于静态的单智能体任务。受Dixit游戏的启发,我们引入了DixitWorld,这是一个旨在解构这一挑战的综合评估套件。DixitWorld包含两个核心组件:DixitArena,一个动态的多智能体环境,在不完全信息下评估假设生成(“讲故事者”制作隐晦线索)和假设选择(“听众”从干扰项中选择目标图像);以及DixitBench,一个静态的问答基准,用于隔离听众任务以进行高效、受控的评估。来自DixitArena的结果揭示了不同的、依赖于角色的行为:较小的开源模型通常擅长作为创造性的讲故事者,产生富有想象力但区分度较低的线索,而较大的专有模型则表现出优越的整体性能,尤其是在作为听众时。在DixitBench上的表现与DixitArena中的听众结果强相关,验证了其作为假设选择的可靠代理。我们的发现揭示了多模态溯因推理中生成创造力与判别理解之间的关键权衡,这是开发更平衡、更有能力的视觉语言智能体的核心挑战。
引用
@article{arxiv.2510.10117,
title = {DixitWorld: Evaluating Multimodal Abductive Reasoning in Vision-Language Models with Multi-Agent Dixit Gameplay},
author = {Yunxiang Mo and Tianshi Zheng and Qing Zong and Jiayu Liu and Baixuan Xu and Yauwai Yim and Chunkit Chan and Jiaxin Bai and Yangqiu Song},
journal= {arXiv preprint arXiv:2510.10117},
year = {2025}
}
备注
EMNLP 2025 Wordplay (Spotlight)