面向实时情境推理的多模态大语言模型
机器人学
2026-02-03 v1
摘要
本研究探索了多模态大语言模型如何支持实时情境感知和价值导向的决策-making。为此,我们将GPT-4o语言模型与TurtleBot 4平台相结合,后者在家中模拟智能吸尘机器人。模型通过视觉输入评估环境,并确定是否appropriate(恰当)地启动清洁程序。该系统突显了这些模型推理家庭活动、社交规范和用户偏好能力,能够做出符合涉及者价值观(如干净、舒适和安全)的细腻决策。我们在逼真的家庭环境中展示了该系统,显示其能够从有限的视觉输入中推断情境和价值观。我们的结果突显了多模态大语言模型在增强机器人自主性和情境意识方面的潜力,同时也强调了与一致性、偏好和实时性能相关的挑战。
引用
@article{arxiv.2602.01880,
title = {Multimodal Large Language Models for Real-Time Situated Reasoning},
author = {Giulio Antonio Abbo and Senne Lenaerts and Tony Belpaeme},
journal= {arXiv preprint arXiv:2602.01880},
year = {2026}
}
备注
Submitted to the interactivity track of the 21st ACM/IEEE International Conference on Human-Robot Interaction on December 2025, accepted January 2026