中文

CT2C-QA:面向中文文本、表格和图表的多模态问答

计算与语言 2024-10-30 v1 人工智能

摘要

多模态问答(MMQA)至关重要,因为它通过整合来自表格、图表和文本等不同数据表示的见解,能够实现全面的理解和准确的回答。现有大多数 MMQA 研究仅关注两种模态,如图像-文本问答、表格-文本问答和图表-文本问答,而针对文本、表格和图表联合分析的研究仍然显著匮乏。在本文中,我们提出了 CT2\text{T}^2C-QA,这是一个开创性的基于中文推理的问答数据集,包含从 200 个精选网页中精心汇编的大量文本、表格和图表。我们的数据集模拟了真实网页,是对模型分析和推理多模态数据能力的极佳测试,因为问题的答案可能出现在各种模态中,甚至可能根本不存在。此外,我们提出了 AED(分配、专家和决策),这是一个通过不同智能体之间的协作部署、信息交互和集体决策实现的多智能体系统。具体来说,分配智能体负责选择和激活专家智能体,包括精通文本、表格和图表的智能体。决策智能体则负责根据这些专家智能体提供的分析见解,给出最终判断。我们进行了全面分析,将 AED 与 MMQA 中各种最先进的模型(包括 GPT-4)进行了比较。实验结果表明,包括 GPT-4 在内的当前方法尚未达到我们数据集设定的基准。

关键词

引用

@article{arxiv.2410.21414,
  title  = {CT2C-QA: Multimodal Question Answering over Chinese Text, Table and Chart},
  author = {Bowen Zhao and Tianhao Cheng and Yuejie Zhang and Ying Cheng and Rui Feng and Xiaobo Zhang},
  journal= {arXiv preprint arXiv:2410.21414},
  year   = {2024}
}

备注

10 pages, 6 figures