中文

文本还是图像?对表问答输入表示与模型有效性的细粒度分析

计算与语言 2025-05-21 v1

摘要

在表问答(TQA)中,表可以被编码为文本或图像。先前的工作表明,将表图像传递给多模态大语言模型(MLLM)的性能与使用文本输入的大语言模型(LLM)相当或更好。然而,缺乏受控设置限制了对这些方法之间进行细粒度区分。本文首次对表的表示和模型的有效性进行受控研究,从两个角度进行分析:问题复杂度和表大小。我们构建了一个新的基准,基于现有的TQA数据集。在对七对MLLM和LLM的系统性分析中,我们发现表的表示和模型的最佳组合会因情境而异。我们提出了FRES方法,用于动态选择表的表示,并观察到与不当两种表示同时使用的平均性能相比,实现了约10%的提升。

关键词

引用

@article{arxiv.2505.14131,
  title  = {Texts or Images? A Fine-grained Analysis on the Effectiveness of Input Representations and Models for Table Question Answering},
  author = {Wei Zhou and Mohsen Mesgar and Heike Adel and Annemarie Friedrich},
  journal= {arXiv preprint arXiv:2505.14131},
  year   = {2025}
}

备注

Accepted at ACL25 (Findings)