中文

面向表格与文本问答的混合图方法

计算与语言 2025-01-30 v1 人工智能

摘要

需要跨越结构化(表格)和非结构化(原始文本)数据源进行推理与聚合的问答问题 presents significant挑战。当前方法依赖于微调和高质量的人工标注数据,这种数据难以获得。大型语言模型(LLM)的最新进展在单一来源文本数据上以零样本 setting下展示了对多跳问答(QA)的有前景的结果,但针对多来源表格-文本问答的探索仍有限。本文提出了一种用于表格-文本问答的 novel 混合图方法,该方法利用 LLM 而无需微调。该方法从文本和表格数据构建统一的混合图,并根据输入问题对信息进行修剪,以简洁地为 LLM 提供相关上下文。我们在具有挑战性的 Hybrid-QA 和 OTT-QA 数据集上评估了该方法,使用了包括 GPT-3.5、GPT-4 和 LLaMA-3 在内的 state-of-the-art LLM。该方法在两个数据集上实现了最佳的 zero-shot performance,Hybrid-QA 上提高了最高达 10% 的 Exact Match 分数,OTT-QA 上提高了 5.4%。此外,本方法相对于原始上下文减少了最高达 53% 的 token 使用。

关键词

引用

@article{arxiv.2501.17767,
  title  = {Hybrid Graphs for Table-and-Text based Question Answering using LLMs},
  author = {Ankush Agarwal and Ganesh S and Chaitanya Devaguptapu},
  journal= {arXiv preprint arXiv:2501.17767},
  year   = {2025}
}

备注

Accepted at NAACL 2025 Main Track