中文

多语言多模态:数据集、技术、挑战与机遇的分类学综述

计算与语言 2022-11-01 v1

摘要

将语言技术置于单一语言之外进行语境化,催生了对多种模态与语言的接纳。 individually,这些方向中的每一者无疑都已扩展为若干 NLP 任务。尽管有此势头,多数多模态研究主要以英语为中心,而多语言研究主要以文本模态的语境为中心。挑战这一传统设定,研究者们研究了多语言与多模态 (MultiX) 流的统一。本工作的主要目标是通过描绘任务、数据集与方法的类别来对这些工作进行分类与刻画,以应对 MultiX 场景。为此,我们综述了所研究的语言、带有并行标注的黄金或银标数据,并理解这些模态与语言在建模中如何交互。我们呈现了建模方法的评述及其优劣,以更好地理解它们在何种场景下可被可靠使用。此后,我们呈现了该领域整体范式的高层趋势。最后,我们以呈现挑战与有前景的研究方向的路线图作结。

关键词

引用

@article{arxiv.2210.16960,
  title  = {Multilingual Multimodality: A Taxonomical Survey of Datasets, Techniques, Challenges and Opportunities},
  author = {Khyathi Raghavi Chandu and Alborz Geramifard},
  journal= {arXiv preprint arXiv:2210.16960},
  year   = {2022}
}