面向文本、表格与图像问答的统一语言表示
计算与语言
2023-06-30 v1
摘要
当试图回答复杂问题时,人们常依赖多种信息源,如视觉、文本和表格数据。此前解决该问题的方法侧重于在多模态空间中设计输入特征或模型结构,这不利于跨模态推理或数据高效训练。在本文中,我们倡导一种替代范式,将图像和表格转换为统一语言表示,从而将任务简化为可在语言空间内通过检索、排序和生成三步解决的最简文本问答问题。该思路利用了预训练语言模型的能力,并在名为Solar的框架中实现。我们的实验结果表明,在MultimodalQA和MMCoQA两个数据集上,Solar以十分显著的差距(10.6-32.3分)在十项不同指标上优于所有现有方法。此外,Solar在WebQA排行榜上取得了最佳性能。
引用
@article{arxiv.2306.16762,
title = {Unified Language Representation for Question Answering over Text, Tables, and Images},
author = {Bowen Yu and Cheng Fu and Haiyang Yu and Fei Huang and Yongbin Li},
journal= {arXiv preprint arXiv:2306.16762},
year = {2023}
}
备注
Findings of ACL 2023