CLUE:基于注意力的跨模态歧义消解
机器人学
2026-02-10 v1
摘要
随着机器人日益融入日常生活,人机交互变得更加复杂多样。其关键组成部分是交互式视觉定位 (Interactive Visual Grounding, IVG),通过该机制机器人必须解释人类意图并消除歧义。现有 IVG 模型通常缺乏确定何时询问澄清问题的机制,因而依赖隐式学习到的表示。CLUE 通过将 VLM 的跨模态注意力转换为用于决定是否询问的显式、空间对齐信号来解决这一问题。我们提取文本到图像注意力图并传递给轻量级 CNN 以检测指代歧义,同时使用 LoRA 微调的解码器进行对话并发出定位标记。我们在真实世界的 IVG 数据集和混合歧义数据集上进行训练。仅凭 InViG 监督,我们的模型在使用参数高效微调的情况下超过了最新方法,同时歧义检测器也超越了先前的基线。总体而言,CLUE 将 VLM 内部的跨模态注意力转换为用于决定何时询问的显式、空间对齐信号。数据和代码均公开于:mouadabrini.github.io/clue
引用
@article{arxiv.2602.08999,
title = {CLUE: Crossmodal disambiguation via Language-vision Understanding with attEntion},
author = {Mouad Abrini and Mohamed Chetouani},
journal= {arXiv preprint arXiv:2602.08999},
year = {2026}
}