中文

图像搜索的当代艺术:通过视觉语言模型迭代用户意图扩展

信息检索 2023-12-06 v2 人工智能 计算机视觉与模式识别 人机交互

摘要

图像搜索是一种基本且用户友好的方法,用于探索海量数字图像库。然而,现有的图像搜索方法严重依赖于标签匹配或图像相似性等邻近度量,需要精确的用户输入才能获得令人满意的结果。为了满足对能够准确理解用户搜索意图的当代图像搜索引擎日益增长的需求,我们引入了一个创新的用户意图扩展框架。我们的框架利用视觉语言模型来解析和组合多模态用户输入,以提供更准确和令人满意的结果。它包含两个阶段的过程:1)解析阶段,包含一个带有大语言模型的语言解析模块,以增强对文本输入的理解,以及一个视觉解析模块,该模块集成了一个交互式分割模块,以快速识别图像中的详细视觉元素;2)逻辑组合阶段,将多个用户搜索意图组合成一个统一的逻辑表达式,以便在复杂搜索场景中进行更复杂的操作。此外,意图扩展框架使用户能够与搜索结果进行灵活的上下文交互,以进一步迭代地指定或调整其详细的搜索意图。我们将该框架实现为一个用于NFT(非同质化代币)搜索的图像搜索系统,并进行了用户研究以评估其可用性和新颖特性。结果表明,所提出的框架显著改善了用户的图像搜索体验。特别是解析和上下文交互被证明有助于用户更准确地表达其搜索意图,并享受更愉快的迭代搜索体验。

关键词

引用

@article{arxiv.2312.01656,
  title  = {The Contemporary Art of Image Search: Iterative User Intent Expansion via Vision-Language Model},
  author = {Yilin Ye and Qian Zhu and Shishi Xiao and Kang Zhang and Wei Zeng},
  journal= {arXiv preprint arXiv:2312.01656},
  year   = {2023}
}

备注

Accepted by The 2024 ACM SIGCHI Conference on Computer-Supported Cooperative Work & Social Computing (CSCW) (Proc. CSCW 2024)