中文

复合草图+文本查询:检索难以命名的物体及其复杂交互

计算机视觉与模式识别 2025-02-13 v1 人工智能 计算与语言 信息检索 多媒体

摘要

非母语者通常虽能想象特定物体,却难以用词汇命名,例如澳大利亚境外者搜索“纳姆巴”(numbats)。此外,用户可能希望通过难以绘制的交互方式检索此类难以命名的物体,例如“纳姆巴在地中挖掘”。在这种常见但复杂的情境下,用户希望使用搜索界面,接受由手绘草图(难以命名但易于绘制的物体)和文本描述(难以草图化但易于语言化的物体属性或与场景的交互)组成的复合多模态查询。与此前研究的文本基图像检索(TBIR)和草图基图像检索(SBIR)问题截然不同。为探索这一少数子任务,本文构建了约200万条查询、10.8万张自然场景图像的 CSTBIR(Composite Sketch+Text Based Image Retrieval) 数据集。作为解决方案,本文提出一种基于预训练多模态变换器的基线模型 STNET(Sketch+Text Network),通过手绘草图在自然场景图像中定位相关物体,并对文本和图像进行编码完成图像检索。除对比学习外,本文还提出多项训练目标以提升模型性能。大量实验表明,我们的方法在文本查询、草图查询及复合查询三种模态下均优于多个最新检索方法。我们将公开数据集和代码。

关键词

引用

@article{arxiv.2502.08438,
  title  = {Composite Sketch+Text Queries for Retrieving Objects with Elusive Names and Complex Interactions},
  author = {Prajwal Gatti and Kshitij Parikh and Dhriti Prasanna Paul and Manish Gupta and Anand Mishra},
  journal= {arXiv preprint arXiv:2502.08438},
  year   = {2025}
}

备注

Accepted at AAAI 2024, 9 pages. Project Website: https://vl2g.github.io/projects/cstbir