AssoCiAm:用于绕过歧义性评估关联思维能力的基准
计算与语言
2025-09-19 v2
摘要
多模态大语言模型 (MLLM) 的最新进展引起了广泛关注,为实现人工通用智能 (AGI) 提供了有前景的路径。在 AGI 所必需的关键能力中,创造力已成为 MLLM 的关键特性,而关联思维则是其基础。关联反映了模型进行创造性思考的能力,是评估和理解其作用的关键。虽然已提出若干框架来评估关联能力,但常常忽略关联任务中固有的歧义性,这种歧义源于关联的多样性,削弱了评估的可靠性。为此,我们将歧义性分为内部歧义和外部歧义两类,提出AssoCiAm基准,通过混合计算方法绕过歧义性,以评估关联思维能力。我们随后对 MLLMs 进行大规模实验,发现认知能力与关联能力呈强正相关。此外,我们观察到评估过程中存在歧义性会导致 MLLMs 的行为更接近随机化。最后,我们验证了该方法在确保评估更准确可靠方面的有效性。有关数据和代码,请参见项目页面。
引用
@article{arxiv.2509.14171,
title = {AssoCiAm: A Benchmark for Evaluating Association Thinking while Circumventing Ambiguity},
author = {Yifan Liu and Wenkuan Zhao and Shanshan Zhong and Jinghui Qin and Mingfu Liang and Zhongzhan Huang and Wushao Wen},
journal= {arXiv preprint arXiv:2509.14171},
year = {2025}
}
备注
Accepted by EMNLP 2025 main track