中文

基于大语言模型的交互式文本到图像检索:插即式方法

计算机视觉与模式识别 2024-07-26 v2

摘要

本文主要解决交互式文本到图像检索任务中对话式上下文查询的问题。我们的 методology PlugIR主动利用大语言模型(LLM)的通用指令遵循能力,主要以两种方式实现。首先,通过改造对话式上下文,消除对在现有视觉对话数据上对检索模型进行微调的必要性,从而 enables 使用任意黑盒模型。其次,我们构建LLM问答者,基于当前检索候选图像的上下文信息,生成关于目标图像属性的非冗余问题。该方法缓解了生成问题的噪声和冗余问题。除本方法论之外,我们提出了一种新型评估指标——最佳对数秩积分(BRI),用于全面评估交互式检索系统。PlugIR在各种基准测试中均优于零样本和微调基线。此外,PlugIR包含的两种方法论可以灵活地在各种情况下单独或组合应用。我们的代码已公开于 https://github.com/Saehyung-Lee/PlugIR。

关键词

引用

@article{arxiv.2406.03411,
  title  = {Interactive Text-to-Image Retrieval with Large Language Models: A Plug-and-Play Approach},
  author = {Saehyung Lee and Sangwon Yu and Junsung Park and Jihun Yi and Sungroh Yoon},
  journal= {arXiv preprint arXiv:2406.03411},
  year   = {2024}
}

备注

ACL 2024 Oral