中文

See What I Mean:面向视频细粒度目标理解的视觉与语言表示对齐

计算机视觉与模式识别 2026-05-19 v1 人工智能 人机交互

摘要

我们提出了 SWIM (See What I Mean),一种新颖的训练策略,通过对齐视觉与语言表示来仅从文本提示实现细粒度目标理解。与需要显式视觉提示(如掩码或点)的现有方法不同,SWIM 仅在训练期间利用掩码监督来引导跨模态注意力,使模型能够在推理时自动关注用户指定的目标。我们对预训练多模态大语言模型(MLLMs)的交叉注意力分析揭示了一个系统性差异:属性词在视觉模态中产生尖锐、局部的激活,而目标名词由于语义参考偏差和分布式高层表示而产生弥散且分散的模式。为了解决这种不对齐问题,我们构建了 NL-Refer,一个增强的数据集,其中每个目标掩码都配有一个精确的自然语言指代表达式。SWIM 从目标名词中提取多层交叉注意力图,并强制其与真实掩码保持空间一致性。实验结果表明,SWIM 显著改善了文本-视觉对齐,并在细粒度目标理解基准上取得了优于基于视觉提示方法的性能。代码和数据可在 \href{https://github.com/HumanMLLM/SWIM}{https://github.com/HumanMLLM/SWIM} 获取。

关键词

引用

@article{arxiv.2605.18018,
  title  = {See What I Mean: Aligning Vision and Language Representations for Video Fine-grained Object Understanding},
  author = {Boyuan Sun and Bowen Yin and Yuanming Li and Xihan Wei and Qibin Hou},
  journal= {arXiv preprint arXiv:2605.18018},
  year   = {2026}
}