一切信息就值一张截图:统一搜索与可视化信息检索
计算与语言
2025-02-18 v1
摘要
随着多模态技术的流行,越来越多的人关注以视觉形式获取有用信息。在本工作中,我们正式定义了一种新兴的信息检索范式,称为 Visualized Information Retrieval(Vis-IR),其中包括文本、图像、表格和图表等多模态信息,通过统一的视觉格式称为 Screenshots 进行联合表示,以适用于各种检索应用。我们对 Vis-IR 作出了三大主要贡献:其一,构建了 VIRA(Vis-IR Aggregation),一个大规模数据集,收集了来自多样来源的大量截图,精心整理为带描述和问答格式;其二,开发了 UniSE(Universal Screenshot Embeddings),一组检索模型,使截图能够跨任意数据模态进行查询或被查询;其三,构建了 MVRB(Massive Visualized IR Benchmark),涵盖多种任务形式和应用场景。通过在 MVRB 上的大量评估,我们揭示了现有多模态检索器的不足以及 UniSE 所带来的显著提升。我们的工作将向社区开放,为这一新兴领域奠定坚实基础。
引用
@article{arxiv.2502.11431,
title = {Any Information Is Just Worth One Single Screenshot: Unifying Search With Visualized Information Retrieval},
author = {Ze Liu and Zhengyang Liang and Junjie Zhou and Zheng Liu and Defu Lian},
journal= {arXiv preprint arXiv:2502.11431},
year = {2025}
}