多语言多模态:数据集、技术、挑战与机遇的分类学综述
计算与语言
2022-11-01 v1
摘要
将语言技术置于单一语言之外进行语境化,催生了对多种模态与语言的接纳。 individually,这些方向中的每一者无疑都已扩展为若干 NLP 任务。尽管有此势头,多数多模态研究主要以英语为中心,而多语言研究主要以文本模态的语境为中心。挑战这一传统设定,研究者们研究了多语言与多模态 (MultiX) 流的统一。本工作的主要目标是通过描绘任务、数据集与方法的类别来对这些工作进行分类与刻画,以应对 MultiX 场景。为此,我们综述了所研究的语言、带有并行标注的黄金或银标数据,并理解这些模态与语言在建模中如何交互。我们呈现了建模方法的评述及其优劣,以更好地理解它们在何种场景下可被可靠使用。此后,我们呈现了该领域整体范式的高层趋势。最后,我们以呈现挑战与有前景的研究方向的路线图作结。
引用
@article{arxiv.2210.16960,
title = {Multilingual Multimodality: A Taxonomical Survey of Datasets, Techniques, Challenges and Opportunities},
author = {Khyathi Raghavi Chandu and Alborz Geramifard},
journal= {arXiv preprint arXiv:2210.16960},
year = {2022}
}