IntentVLM:通过视频语言模型的前向-逆向建模进行开词汇意图识别
人机交互
2026-04-28 v1 人工智能
多媒体
摘要
提高人机交互的有效性需要社交机器人能够通过稳健的意图理解准确推断人类目标。在多模态环境中,这一挑战尤为关键,因为代理必须整合包括文本和视觉线索在内的异构信号,以形成对用户意图的连贯解释。本文提出IntentVLM,一个新的两阶段视频语言框架,用于开词汇的人类意图识别。该方法受认知科学中的前向-逆向建模启发,通过将意图理解分解为目标候选生成 followed by 结构化推理选择,有效减少潜在推理中的幻觉。我们在IntentQA和Inst-IT Bench数据集上评估了IntentVLM,达到了最新的最佳成绩,准确率最高可达80%,显著超过基线性能30%,并与人类水平持平。我们的发现表明,这种结构化推理方法在不产生灾难性遗忘的前提下,增强了开词汇意图理解,为以以人类为中心的机器人提供了稳健的基础。
引用
@article{arxiv.2604.24002,
title = {IntentVLM: Open-Vocabulary Intention Recognition through Forward-Inverse Modeling with Video-Language Models},
author = {Hamed Rahimi and Clemence Grislain and Adrien Jacquet Cretides and Olivier Sigaud and Mohamed Chetouani},
journal= {arXiv preprint arXiv:2604.24002},
year = {2026}
}