指代表达式实例检索及其强端到端基线
密码学与安全
2025-06-24 v1 人工智能
软件工程
摘要
使用自然语言查询视觉信息是现实应用中的基本需求。文本-图像检索(TIR)基于图像级描述从资料库中检索目标图像,而指代表达式理解(REC)则使用实例级描述在给定图像中定位目标对象。然而,现实应用往往提出更复杂的需求。用户通常会针对实例级描述跨大型资料库进行查询,并期望同时获得相关图像及对应的实例位置。在此情境下,TIR难以处理细粒度描述和对象级定位,而REC在高效检索大型资料库和缺乏有效排序机制方面受限。本文提出一种新任务,即指代表达式实例检索(REIR),支持基于细粒度指代表达式的实例级检索与定位。首先,我们提出了规模庞大的REIR基准,命名为REIRCOCO,利用高级视觉语言模型为MSCOCO和RefCOCO数据集中的实例生成高质量指代表达式。其次,我们提出了一种基线方法——基于关系专家的对比语言-实例对齐(CLARE),采用双流架构端到端解决REIR问题。给定指代表达式,文本分支将其编码为查询嵌入;视觉分支检测候选对象并提取其实例级视觉特征。选择与查询最相似的候选对象进行边界框预测。CLARE首先在对象检测和REC数据集上进行训练以建立初始定位能力,然后通过对比语言-实例对齐(CLIA)进行优化以提升跨图像检索性能。我们将公开发布代码和基准数据集。
引用
@article{arxiv.2506.18245,
title = {Smart-LLaMA-DPO: Reinforced Large Language Model for Explainable Smart Contract Vulnerability Detection},
author = {Lei Yu and Zhirong Huang and Hang Yuan and Shiqi Cheng and Li Yang and Fengjun Zhang and Chenjie Shen and Jiajia Ma and Jingyuan Zhang and Junyi Lu and Chun Zuo},
journal= {arXiv preprint arXiv:2506.18245},
year = {2025}
}
备注
Accepted to ISSTA 2025