中文

HELIOS:多粒度表格-文本检索中的早期融合、晚期融合与LLM推理融合

数据库 2026-03-04 v1 计算与语言 信息检索 机器学习

摘要

表格-文本检索旨在检索以支持开域问答的相关表格和文本。现有研究要么采用早期融合,要么采用晚期融合,但面临局限性。早期融合将表格行与其关联段落预先对齐,形成“星形”结构,通常包括不相关的上下文,并遗漏查询依赖的关系。晚期融合检索单个节点,动态地对其进行对齐,但风险在于遗漏相关上下文。两种方法也难以处理诸如列级聚合和多跳推理等高级推理任务。为此,我们提出HELIOS,将两者的优势结合在一起。首先,基于边的二分子子图检索识别表格片段与段落之间更细粒度的边,有效避免不相关上下文的包含。然后,查询相关节点扩展识别最有前景的节点,动态检索相关边以扩大二分子子图,最大限地降低遗漏重要上下文的风险。最后,基于星形的LLM精炼在星形图层级而非二分子子图上进行逻辑推理,支持高级推理任务。实验结果表明,HELIOS在OTT-QA基准上相对于最先进模型实现了显著提升,召回率提升最高可达42.6%,nDCG提升最高可达39.9%。

关键词

引用

@article{arxiv.2603.02248,
  title  = {HELIOS: Harmonizing Early Fusion, Late Fusion, and LLM Reasoning for Multi-Granular Table-Text Retrieval},
  author = {Sungho Park and Joohyung Yun and Jongwuk Lee and Wook-Shin Han},
  journal= {arXiv preprint arXiv:2603.02248},
  year   = {2026}
}

备注

9 pages, 6 figures. Accepted at ACL 2025 main. Project page: https://helios-projectpage.github.io/