中文

TALENT:通过增强语言-增强自然文本转写实现表格视觉问答

计算与语言 2025-10-09 v1

摘要

表格视觉问答 (Table VQA) 通常由大型视觉语言模型 (VLM) 解决。虽然此类模型可以直接从图像中作答,但除非规模非常大,否则常常忽略细粒度细节,这在移动部署上计算负担重。一种轻量化替代方案是让小型 VLM 执行 OCR,然后使用大语言模型 (LLM) 对诸如 Markdown 表格等结构化输出进行推理。然而,这些表示并不自然优化用于 LLM,仍会引入相当大的错误。我们提出了 TALENT (Table VQA via Augmented Language-Enhanced Natural-text Transcription),一种轻量化框架,利用表格的双重表示。TALENT 提示小型 VLM 同时生成 OCR 文本和自然语言叙述,然后将其与问题组合供 LLM 推理。这将表格 VQA 重新定义为 LLM 中心的多模态推理任务,其中 VLM 充当感知-叙述模块而非单一求解器。此外,我们构建了 ReTabVQA,一个更具挑战性的表格 VQA 数据集,要求对表格图像进行多步骤定量推理。实验表明,TALENT 使小型 VLM-LLM 组合在公共数据集和 ReTabVQA 上能够匹配或超越单一大型 VLM,同时计算成本显著降低。

关键词

引用

@article{arxiv.2510.07098,
  title  = {TALENT: Table VQA via Augmented Language-Enhanced Natural-text Transcription},
  author = {Guo Yutong and Wanying Wang and Yue Wu and Zichen Miao and Haoyu Wang},
  journal= {arXiv preprint arXiv:2510.07098},
  year   = {2025}
}