多模态大型语言模型驱动机器人的感觉运动自我识别
人工智能
2026-04-21 v2 机器人学
摘要
自我识别——在环境中维持对自身身体的内部表征的能力——是智能、自主行为的基础。作为最小自我的基础组成部分,自我识别提供了最终可能涌现出更高形式自我意识的初始基础。大型语言模型的最新进展在整合多模态信息的任务中实现了类人性能,引发了人们对部署在机器人等非人类平台上的 AI 智能体具身能力的日益浓厚的兴趣。我们通过将 LLM 集成到自主移动机器人中,研究多模态 LLM 能否通过感觉运动经验发展出自我识别。该系统表现出鲁棒的环境感知、自我识别和预测意识,使其能够推断其机器人特性和运动特征。结构方程模型揭示了感觉整合如何影响最小自我的不同维度及其与过去-现在记忆的协调,以及驱动自我识别的分层内部关联。感觉输入的消融实验证明了传感器之间的补偿相互作用,并证实了结构化记忆和情景记忆的重要作用。在获得关于世界及其自身的适当感觉信息后,多模态 LLM 为具身认知系统中的人工自我开启了大门。
引用
@article{arxiv.2505.19237,
title = {Sensorimotor Self-Recognition in Multimodal Large Language Model-Driven Robots},
author = {Iñaki Dellibarda Varela and Pablo Romero-Sorozabal and Diego Torricelli and Gabriel Delgado-Oleas and Jose Ignacio Serrano and Maria Dolores del Castillo Sobrino and Eduardo Rocon and Manuel Cebrian},
journal= {arXiv preprint arXiv:2505.19237},
year = {2026}
}
备注
16 pages, 3 figures, 1 table