孟加拉语视觉问答生成
计算与语言
2023-10-13 v1
摘要
视觉问答生成(VQG)的任务是生成与给定图像相关的人类式问题。由于VQG是一个新兴研究领域,现有工作往往因数据集的可得性而仅关注英语等资源丰富语言。本文提出首个孟加拉语视觉问答生成任务,并开发了一种新颖的基于Transformer的编码器-解码器架构,该架构在给定图像时生成孟加拉语问题。我们提出了多种模型变体——(i)仅图像:从图像生成问题而不使用额外信息的基线模型;(ii)图像-类别与图像-答案-类别:引导式VQG,其中我们条件化模型以基于答案与预期问题的类别生成问题。这些模型在翻译的VQAv2.0数据集上训练与评估。我们的定量与定性结果确立了孟加拉语VQG任务的首个最先进(SOTA)模型,并表明我们的模型能够生成语法正确且相关的问题。定量结果显示,我们的image-cat模型取得了33.12的BLUE-1分数与7.56的BLEU-3分数,为其他两种变体中的最高值。我们还进行了人工评价以评估生成任务的质量。人工评价表明,image-cat模型能够生成目标驱动与属性特定的问题,并且与对应图像保持相关。
引用
@article{arxiv.2310.08187,
title = {Visual Question Generation in Bengali},
author = {Mahmud Hasan and Labiba Islam and Jannatul Ferdous Ruma and Tasmiah Tahsin Mayeesha and Rashedur M. Rahman},
journal= {arXiv preprint arXiv:2310.08187},
year = {2023}
}
备注
19 pages including references, 4 figures and 3 tables. Accepted in the Proceedings of the Workshop on Multimodal, Multilingual Natural Language Generation and Multilingual WebNLG Challenge (MM-NLG 2023)