模仿人类:具备测试时推理的元认知智能体
人工智能
2025-12-01 v1
摘要
近期视觉语言模型(VLM)表现出强大的感知推理能力,但在面对新任务时往往难以有效适应。相比之下,人类利用具备记忆的元认知模型,能够通过元认知控制在面对新挑战时持续细化策略。为弥合这一差距,我们提出一种名为metacognitive test-time reasoning(MCTR)的框架,赋予模型在测试时通过元认知自更新学习、适应和改进的能力。灵感来自人类元认知的双重结构,MCTR包含meta-level和object-level VLM推理模块,每个模块都配备专门的记忆系统以实现层次化适应推理。 Specifically,MCTR包括:(1) 一个meta-reasoning模块,通过发现和存储来自测试时观察的任务相关规则、环境模式和动作-结果关系,作为自然语言描述来构建结构化记忆;(2) 一个action-reasoning模块,通过动态检索和集成记忆中的知识,进行情境感知和战略推理以确定最优动作。action-reasoning模块通过proposed的metacognitive test-time reinforcement learning持续更新其策略,随着知识记忆的演化而进行适应。我们在45个Atari游戏(33个seen,12个unseen)上评估了MCTR。MCTR在unseen游戏中实现了9/12的top-1结果。通过ablation分析、学习动力学和案例研究,我们揭示了两个组件的互补贡献,表明meta-reasoning正向人类式适应策略演化。
引用
@article{arxiv.2511.23262,
title = {Adapting Like Humans: A Metacognitive Agent with Test-time Reasoning},
author = {Yang Li and Zhiyuan He and Yuxuan Huang and Zhuhanling Xiao and Chao Yu and Meng Fang and Kun Shao and Jun Wang},
journal= {arXiv preprint arXiv:2511.23262},
year = {2025}
}