翻译增强的多语言文本到图像生成
计算与语言
2024-02-16 v1 人工智能
计算机视觉与模式识别
机器学习
摘要
由于其他语言缺乏标注的图像-描述数据,文本到图像生成(TTI)的研究仍主要集中于英语;从长远来看,这可能加剧 TTI 技术获取的不平等。为此,本文研究多语言 TTI(记为 mTTI)以及神经机器翻译(NMT)在引导 mTTI 系统方面的当前潜力。我们提供两项关键贡献。1)基于多语言多模态编码器,我们对跨语言 NLP 中用于 mTTI 的标准方法进行了系统的实证研究:翻译训练(Translate Train)、翻译测试(Translate Test)和零样本迁移(Zero-Shot Transfer)。2)我们提出集成适配器(Ensemble Adapter, EnsAd),一种新颖的参数高效方法,学习在 mTTI 框架内权衡并整合多语言文本知识,缓解语言鸿沟从而提升 mTTI 性能。我们在标准 mTTI 数据集 COCO-CN、Multi30K Task2 和 LAION-5B 上的评估展示了翻译增强的 mTTI 系统的潜力,并验证了所提 EnsAd 的收益,其在所有数据集上均带来一致提升。关于模型变体、消融研究和定性分析的进一步探究为所提 mTTI 方法的内部机制提供了额外见解。
引用
@article{arxiv.2305.19216,
title = {Translation-Enhanced Multilingual Text-to-Image Generation},
author = {Yaoyiran Li and Ching-Yun Chang and Stephen Rawls and Ivan Vulić and Anna Korhonen},
journal= {arXiv preprint arXiv:2305.19216},
year = {2024}
}
备注
ACL 2023 (Main)