中文

ExpliCIT-QA:基于解释性代码的图像表格问答

计算与语言 2025-07-17 v1 人工智能

摘要

我们提出 ExpliCIT-QA,一个系统,扩展了我们之前的 MRT 方法,使其能够处理复杂表格图像并提供可解释答案。ExpliCIT-QA 采用模块化设计,包括:(1)多模态表格理解,采用链式思考方法从表格图像中提取并转换内容;(2)基于语言的推理,生成逐步的自然语言解释以解决问题;(3)自动代码生成,根据推理步骤创建 Python/Pandas 脚本,并提供错误处理反馈;(4)代码执行以计算最终答案;(5)自然语言解释,描述答案是如何计算得到的。该系统致力于透明度与可审计性:所有中间输出、解析后的表格、推理步骤、生成的代码以及最终答案均可供检查。此策略有助于缩短 end-to-end TableVQA 系统之间的可解释性鸿沟。我们在 TableVQA-Bench 数据集上评估了 ExpliCIT-QA,与现有基线方法进行比较。我们展示了在可解释性与透明度方面的改进,为在财务等敏感领域的应用铺平了道路,这些领域对审计结果至关重要。

关键词

引用

@article{arxiv.2507.11694,
  title  = {ExpliCIT-QA: Explainable Code-Based Image Table Question Answering},
  author = {Maximiliano Hormazábal Lagos and Álvaro Bueno Sáez and Pedro Alonso Doval and Jorge Alcalde Vesteiro and Héctor Cerezo-Costas},
  journal= {arXiv preprint arXiv:2507.11694},
  year   = {2025}
}

备注

This work has been accepted for presentation at the 24nd Portuguese Conference on Artificial Intelligence (EPIA 2025) and will be published in the proceedings by Springer in the Lecture Notes in Computer Science (LNCS) series. Please cite the published version when available