中文

CaughtCheating:你的MLLM是棒棒的作弊侦测员吗?探索视觉感知与推理的边界

计算机视觉与模式识别 2025-07-02 v1 人工智能 计算与语言

摘要

近期代理型多模态大语言模型(MLLM)如GPT-o3在各种现有基准测试中取得接近极限的分数,催生了对更具挑战性测试任务的需求。这些MLLM被报告在专家级人类任务中表现出色,例如GeoGuesser,这反映了其作为侦探的潜力——能够捕捉图像中细微线索并构建连贯的情境解释,从而给出可靠答案。但它们能否匹配顶尖人类侦探的表现?为此,我们调查了GPT-o3仍能应对的一些困难场景,发现存在一类场景其表现几乎归零,我们称之为CaughtCheating。该概念灵感来源于社交媒体上请求他人从帖子作者的伴侣分享的照片中检测可疑线索的请求。我们进行了大量实验与分析,以理解现有MLLM为何无法解决此类任务。CaughtCheating提供了一类具有重要价值和实际应用价值的挑战性视觉感知与推理任务。成功完成此类任务将为MLLM获取人类水平的侦探感知与推理能力开辟道路。

关键词

引用

@article{arxiv.2507.00045,
  title  = {CaughtCheating: Is Your MLLM a Good Cheating Detective? Exploring the Boundary of Visual Perception and Reasoning},
  author = {Ming Li and Chenguang Wang and Yijun Liang and Xiyao Wang and Yuhang Zhou and Xiyang Wu and Yuqing Zhang and Ruiyi Zhang and Tianyi Zhou},
  journal= {arXiv preprint arXiv:2507.00045},
  year   = {2025}
}