从行到推理:基于检索增强的多模态表格理解框架
计算与语言
2026-02-10 v2
摘要
大语言模型(LLMs)在处理包含数千个数值行、多个关联表格以及嵌入图表和收据等视觉内容的大型企业表格时难以进行推理。先前的最先进表格推理方法通常依赖单表格压缩或完整上下文编码,这限制了可扩展性,无法反映用户如何与复杂、多模态工作簿进行交互。我们引入FRTR-Bench,第一个大规模多模态表格推理基准,包含30个企业级 Excel 工作簿,涵盖近400万个单元格和50多张嵌入图像。为解决这些挑战,我们提出从行到推理(FRTR),一个高级的多模态检索增强生成框架,将 Excel 工作簿分解为粒化的行、列和块嵌入,采用混合词法-稠密检索结合逆向排名融合(RRF),并集成多模态嵌入以进行数值和视觉信息的推理。我们在六个大语言模型上测试了FRTR,在FRTR-Bench上实现了74%的答案准确率(使用 Claude Sonnet 4.5),显著优于先前的最先进方法仅达24%。在 SpreadsheetLLM 基准上,FRTR使用 GPT-5 实现了87%的准确率,同时将令牌使用量约降低50%。
引用
@article{arxiv.2601.08741,
title = {From Rows to Reasoning: A Retrieval-Augmented Multimodal Framework for Spreadsheet Understanding},
author = {Anmol Gulati and Sahil Sen and Waqar Sarguroh and Kevin Paul},
journal= {arXiv preprint arXiv:2601.08741},
year = {2026}
}