基于长上下文 Q-Former 集成多模态 LLM 的机器人确认生成与动作规划
机器人学
2025-11-24 v1 计算与语言
计算机视觉与模式识别
声音
音频与语音处理
摘要
人机协作以实现共同目标要求机器人理解人类的动作及其与周围环境的互动。本文聚焦于基于人机对话的人机交互 (HRI),其依赖于机器人动作确认与动作步骤生成,这需要多模态场景理解。现有方法使用多模态变换器从单个呈现任务多个微步骤的短片中生成与机器人动作确认一致的机器人动作步骤。尽管面向长期任务的动作相互依赖于整个视频中的相互关系,但当前方法主要关注短片级处理,未充分利用长上下文信息。本文提出一种集成左右上下文依赖于完整视频中的长上下文 Q-Former。进一步提出一种文本条件化方法,将文本嵌入直接输入到 LLM 解码器中,以缓解 Q-Former 对文本信息的高抽象程度。使用 YouCook2 语料库进行实验表明,确认生成的准确率是动作规划性能的关键因素。此外,我们展示了通过集成 VideoLLaMA3,长上下文 Q-Former 能显著提升确认生成与动作规划。
关键词
引用
@article{arxiv.2511.17335,
title = {Robot Confirmation Generation and Action Planning Using Long-context Q-Former Integrated with Multimodal LLM},
author = {Chiori Hori and Yoshiki Masuyama and Siddarth Jain and Radu Corcodel and Devesh Jha and Diego Romeres and Jonathan Le Roux},
journal= {arXiv preprint arXiv:2511.17335},
year = {2025}
}
备注
Accepted to ASRU 2025