ICU:通过将视觉与语言建模任务划分为图像描述与语言理解来克服语言障碍
计算与语言
2024-02-06 v3
摘要
大多数多语言视觉与语言(V&L)研究旨在在单一模型中实现多语言与多模态能力。然而,图像多语言描述文本的稀缺阻碍了该领域的发展。为克服这一障碍,我们提出 ICU(Image Caption Understanding,图像描述理解),将 V&L 任务划分为两个阶段:一个 V&L 模型用英语执行图像描述,随后一个多语言语言模型(mLM)将该描述作为替代文本并执行跨语言语言理解。多语言处理的负担从 V&L 模型转移到 mLM 上。由于多语言文本数据相对更丰富且质量更高,ICU 有助于克服 V&L 模型的语言障碍。在 IGLUE 基准上跨越 9 种语言的两项任务实验中,我们表明 ICU 能在五种语言上取得新的 SOTA 结果,在其余语言上取得可比结果。
引用
@article{arxiv.2310.12531,
title = {ICU: Conquering Language Barriers in Vision-and-Language Modeling by Dividing the Tasks into Image Captioning and Language Understanding},
author = {Guojun Wu},
journal= {arXiv preprint arXiv:2310.12531},
year = {2024}
}
备注
EMNLP 2023 (Findings)