MultiQG-TI:面向多模态源的问题生成
计算与语言
2023-07-11 v1 人工智能
摘要
我们研究了一个新的自动问题生成(QG)任务,其输入为多模态源(包含图像与文本),这显著扩展了现有大多数仅关注纯文本源 QG 的工作范围。我们针对这一新问题提出了一种简单的解决方案,称为 MultiQG-TI,它使仅处理文本的问答生成器也能处理视觉输入与文本输入。具体而言,我们利用图像到文本模型与光学字符识别(OCR)模型分别获取图像的文字描述并提取图像中的文本,然后将它们与输入文本一同送入问题生成器。我们仅微调问题生成器,而保持其他组件固定。在具有挑战性的 ScienceQA 数据集上,我们证明尽管可训练参数少了一百倍,MultiQG-TI 仍显著优于采用少样本提示的 ChatGPT。额外的分析从经验上确认了视觉与文本信号对于 QG 的必要性,并展示了不同建模选择的影响。
引用
@article{arxiv.2307.04643,
title = {MultiQG-TI: Towards Question Generation from Multi-modal Sources},
author = {Zichao Wang and Richard Baraniuk},
journal= {arXiv preprint arXiv:2307.04643},
year = {2023}
}
备注
Accepted at BEA workshop 2023; code https://github.com/moonlightlane/MultiQG-TI