中文

利用轻量级实体抽取实现基于事件的可扩展图像检索

计算机视觉与模式识别 2025-12-25 v1 人工智能

摘要

从自然语言描述中检索图像是计算机视觉和自然语言处理交叉的一个核心任务,具有广泛的应用前景,包括搜索引擎、媒体归档和数字内容管理等领域。然而,现实中的图像-文本检索因查询模糊或情境依赖、语言变异性以及需要可扩展解决方案等因素仍然具有挑战性。本文提出了一种轻量级两阶段检索管道,利用以事件为中心的实体抽取来整合来自真实标题中的时序和情境信号。第一阶段基于显著实体使用 BM25 进行高效的候选过滤,而第二阶段则应用 BEiT-3 模型捕获深层多模态语义并对结果进行重新排序。在 OpenEvents v1 数据集上进行评估,本方法实现了平均精度为 0.559,显著优于先前的基线方法。这些结果表明,结合事件导向的过滤与长文本视觉语言建模对于在复杂真实场景中实现准确且高效的检索具有有效性。我们的代码已在 https://github.com/PhamPhuHoa-23/Event-Based-Image-Retrieval 上提供。

关键词

引用

@article{arxiv.2512.21221,
  title  = {Leveraging Lightweight Entity Extraction for Scalable Event-Based Image Retrieval},
  author = {Dao Sy Duy Minh and Huynh Trung Kiet and Nguyen Lam Phu Quy and Phu-Hoa Pham and Tran Chi Nguyen},
  journal= {arXiv preprint arXiv:2512.21221},
  year   = {2025}
}

备注

System description paper for EVENTA Grand Challenge Track 2 at ACM Multimedia 2025 (MM '25). Ranked 4th place. 6 pages, 1 figure, 2 tables