中文

使用高效双模态融合回答关于数据可视化的问题

计算机视觉与模式识别 2020-07-23 v2 人工智能 计算与语言 机器学习

摘要

图表问答(CQA)是新近提出的视觉问答(VQA)任务,算法须回答关于数据可视化(如条形图、饼图和折线图)的问题。CQA 需要自然图像 VQA 算法所缺乏的能力:细粒度测量、光学字符识别,以及处理问题与答案中的集外词。若不修改,最先进的 VQA 算法在该任务上表现很差。在此,我们提出一种称为图像与语言并行循环融合(PReFIL)的新型 CQA 算法。PReFIL 首先通过融合问题与图像特征学习双模态嵌入,然后智能聚合这些学到的嵌入以回答给定问题。尽管简单,PReFIL 在 FigureQA 与 DVQA 数据集上大幅超越最先进系统与人类基线。此外,我们展示了 PReFIL 可通过向图表提出一系列问题来重建表格。

关键词

引用

@article{arxiv.1908.01801,
  title  = {Answering Questions about Data Visualizations using Efficient Bimodal Fusion},
  author = {Kushal Kafle and Robik Shrestha and Brian Price and Scott Cohen and Christopher Kanan},
  journal= {arXiv preprint arXiv:1908.01801},
  year   = {2020}
}

备注

Presented at WACV, 2020