中文

基于上下文分词的图形倒排索引

机器学习 2025-11-04 v2

摘要

从大型语料库中检索包含给定查询图的等价子图的图形,是许多实际应用中的核心操作。虽然最近的多向量图表示和基于集合对齐与包含的评分可以提供准确的子图同构测试,但其在检索中的应用受限于需要对语料库图进行彻底评分。我们引入 CORGII(Contextual Representation of Graphs for Inverted Indexing,基于上下文的图形倒排索引),这是一种图形索引框架,其中, starting with a contextual dense graph representation, 一个可微分的离散化模块计算在已学习的潜在词汇表上计算的稀疏二进制代码。这种类似文本文档的表示允许我们利用经典且高度优化的倒排索引,同时支持软(向量)集合包含评分。进一步地,我们用数据驱动、可训练的影响权重取代经典的、固定的“标记”对图形的影响权重(如 TFIDF 或 BM25)。最后,我们探索标记扩展以支持多探针索引,以实现更平滑的准确性与效率之间的权衡。到我们知识之时,CORGII 是首个使用离散标记映射到高效倒排列表的稠密图表示索引器。广泛的实验表明,CORGII 在准确性与效率之间的权衡优于多个基线方法。

关键词

引用

@article{arxiv.2510.22479,
  title  = {Contextual Tokenization for Graph Inverted Indices},
  author = {Pritish Chakraborty and Indradyumna Roy and Soumen Chakrabarti and Abir De},
  journal= {arXiv preprint arXiv:2510.22479},
  year   = {2025}
}