多模态问题讨论:来自科学图表的询问性问题
计算与语言
2026-04-28 v1
摘要
阅读时提出并寻找答案的探究性问题是人类话语理解、好奇心和创造性思维的重要部分,此前的研究仅针对文本场景进行探讨。然而,在科学或研究论文中,许多关键要点是通过图表和分析图表的文本共同表达的。虽然科学可视化已被用于评估视觉语言模型(VLM)的能力,但当前基准仅限于聚焦于从图表中提取信息的问题,这类问题仅要求低层次推理,不考虑图表出现的上下文,也不反映作者所希望实现的交际目标。我们生成具备探究性问题,这些问题具备人类在与科学论文互动时所产生的深度,同时考虑图表与论文上下文,要求跨模态推理。为实现此目标,我们将问题论(QUD)的语言理论从文本单一模式扩展到多模态模式,其中在话语进程中提出并解决隐含问题。我们提出MQUD数据集,包含多篇研究论文,其中明确化这些问题并由原始作者进行标注。我们表明,对MQUD进行微调的VLM能够从生成通用低层次视觉问题转向需要高层次多模态推理的内容特定 grounding,生成更高质量、更具视觉依托的多模态QUD。
引用
@article{arxiv.2604.23733,
title = {Multimodal QUD: Inquisitive Questions from Scientific Figures},
author = {Yating Wu and William Rudman and Venkata S Govindarajan and Alexandros G. Dimakis and Junyi Jessy Li},
journal= {arXiv preprint arXiv:2604.23733},
year = {2026}
}