中文

大模型能骗过人眼吗?针对生物动画的新图灵测试

计算机视觉与模式识别 2025-08-11 v1 人工智能

摘要

评估大模型的能力并揭示其差距具有挑战性。当前的基准测试要么采用基于真值的静态数据集评分式评估,要么采用模糊的文本聊天机器人式人类偏好收集,这可能无法为用户提供关于性能差异的即时、直观和可感知的反馈。在本文中,我们引入了 BioMotion Arena,这是一个通过视觉动画评估大语言模型(LLM)和多模态大语言模型(MLLM)的新颖框架。我们的方法灵感来源于对生物体运动模式固有的视觉感知,利用点光源成像来放大模型之间的性能差异。具体来说,我们采用成对比较评估,并针对 90 种生物运动变体,收集了 53 个主流 LLM 和 MLLM 的超过 4.5 万张投票。数据分析表明,众包的人类投票与专家评分者的投票具有良好的一致性,证明了我们的 BioMotion Arena 在提供区分性反馈方面的优越性。我们还发现,超过 90% 的评估模型,包括前沿的开源 InternVL3 和专有的 Claude-4 系列,都无法生成基本的人形点光源组,更不用说流畅且符合生物学的运动了。这使得 BioMotion Arena 能够作为一个具有挑战性的性能可视化基准,以及一个不受真值限制的灵活评估框架。

关键词

引用

@article{arxiv.2508.06072,
  title  = {Can Large Models Fool the Eye? A New Turing Test for Biological Animation},
  author = {Zijian Chen and Lirong Deng and Zhengyu Chen and Kaiwei Zhang and Qi Jia and Yuan Tian and Yucheng Zhu and Guangtao Zhai},
  journal= {arXiv preprint arXiv:2508.06072},
  year   = {2025}
}

备注

24 pages, 10 figures