中文

评估交互式AI代理中的认知年龄对齐性

人工智能 2026-05-19 v1

摘要

尽管代理式AI及其核心多模态大语言模型(MLLM)在从日常生活到先进科学研究等领域展现出在语言和视觉推理方面的巨大潜力,但人工智能与人类智慧之间仍存在显著鸿沟。尽管集成了强大的工具和先进的MLLM,尽管状态最先进的AI代理在看似简单的基础任务上仍常常失败,这些任务是孩子可以轻松解决的。以灵氏儿童智力量表(WISC)为灵感,我们引入ChildAgentEval——第一个基于心理测量学的交互式基准,用于评估基于MLLM的代理的认知年龄对齐性。ChildAgentEval系统性地将各种基于MLLM的交互式代理的推理性能与特定年龄段的人类发展阶段进行比较,揭示了当前代理式AI系统在哪些方面可以且不能在特定认知行为方面进行模拟。

关键词

引用

@article{arxiv.2605.17894,
  title  = {Evaluating Cognitive Age Alignment in Interactive AI Agents},
  author = {Yifan Shen and Jiawen Zhang and Jian Xu and Junho Kim and Ismini Lourentzou and Xu Cao and Meihuan Huang},
  journal= {arXiv preprint arXiv:2605.17894},
  year   = {2026}
}