中文

VIRTUE:面向视觉交互的文本-图像通用嵌入器

人工智能 2026-02-24 v2 计算机视觉与模式识别

摘要

多模态表示学习模型已在复杂任务中成功运行,视觉语言模型(VLM)的集成进一步使嵌入模型具备指令遵循能力。然而,现有嵌入模型缺乏视觉交互能力,可从用户处指定感兴趣的区域(例如点、边界框或掩码),这一功能已在生成模型中探索,以拓宽其人类交互适用性。赋予嵌入模型视觉交互能力不仅能解锁以用户意图为导向的局部 grounding 的新应用,这些应用尚未被探索;还能使模型学习图像中的实体级信息,从而补充其用于常规嵌入任务的全局表示。在本文中,我们提出一种新型视觉交互文本-图像通用嵌入器(VIRTUE),其扩展了分段模型和视觉语言模型的能力,纳入表示学习范畴。在VIRTUE中,分段模型可处理指定图像特定区域的视觉提示,从而使嵌入器能够更精确地处理复杂且含义模糊的场景。为评估VIRTUE的视觉交互能力,我们引入了一个大规模的分段与场景描述检索(Segmentation-and-Scene Caption Retrieval, SCaR)基准数据集,包含100万个样本,旨在通过联合考虑特定对象与图像场景来检索文本标题。在36项通用MMEB任务(改进3.1%-8.5%)和5项视觉交互SCaR任务(改进15.2%-20.3%)上,VIRTUE始终实现了最新的性能。

关键词

引用

@article{arxiv.2510.00523,
  title  = {VIRTUE: Visual-Interactive Text-Image Universal Embedder},
  author = {Wei-Yao Wang and Kazuya Tateishi and Qiyu Wu and Shusuke Takahashi and Yuki Mitsufuji},
  journal= {arXiv preprint arXiv:2510.00523},
  year   = {2026}
}

备注

ICLR 2026. 25 pages. Project page: https://sony.github.io/virtue/