MUST-VQA:多语言场景文本视觉问答
计算机视觉与模式识别
2022-09-15 v1
摘要
本文提出一种以零样本方式处理新语言的多语言场景文本视觉问答框架。具体而言,我们考虑场景文本视觉问答(STVQA)任务,其中问题可用不同语言提出,且不一定与场景文本语言对齐。因此,我们首先引入朝向更广义STVQA的自然一步:MUST-VQA。对此,我们在受限设定下讨论两种评估场景,即独立同分布(IID)与零样本,并证明模型在零样本设定下表现相当。我们进一步提供了大量实验,展示了将多语言语言模型适配到STVQA任务的有效性。
引用
@article{arxiv.2209.06730,
title = {MUST-VQA: MUltilingual Scene-text VQA},
author = {Emanuele Vivoli and Ali Furkan Biten and Andres Mafla and Dimosthenis Karatzas and Lluis Gomez},
journal= {arXiv preprint arXiv:2209.06730},
year = {2022}
}
备注
To be appeared in Text In Everything Workshop in ECCV 2022