中文

ObjEmbed:面向通用多模态目标嵌入的研究

计算机视觉与模式识别 2026-02-04 v2

摘要

将对象与对应的文本描述进行对齐,是视觉语言理解中的一个基本挑战,也是现实需求。在多模态嵌入模型方面,虽然在全局图像-文本对齐方面表现优异,但往往在图像区域与特定短语的细粒度对齐方面存在困难。本文提出了 ObjEmbed,一种新的多模态大语言模型嵌入模型,该模型将输入图像分解为多个区域嵌入,每个区域嵌入对应单个对象,同时包含全局嵌入。它支持诸如视觉定位、局部图像检索和全局图像检索等多种视觉理解任务。ObjEmbed 具备三个关键特性:(1)面向对象表示:通过为每个区域生成两个互补的嵌入来捕捉对象的语义与空间信息:一个用于语义匹配的对象嵌入,以及预测局部化质量的 IoU 嵌入。最终的对象匹配得分将语义相似性与预测的 IoU 结合,从而实现更精确的检索。(2)通用性:无缝处理区域级和图像级任务。(3)高效编码:在单次前向传播中对图像中的所有对象以及整幅图像进行编码,具有高效性。18 个多样化基准测试的优异性能表明其在语义辨别方面具有强大能力。

关键词

引用

@article{arxiv.2602.01753,
  title  = {ObjEmbed: Towards Universal Multimodal Object Embeddings},
  author = {Shenghao Fu and Yukun Su and Fengyun Rao and Jing Lyu and Xiaohua Xie and Wei-Shi Zheng},
  journal= {arXiv preprint arXiv:2602.01753},
  year   = {2026}
}