中文

ZeroNLG:通过对齐与自编码域实现零样本多模态多语言自然语言生成

计算与语言 2024-06-04 v3 人工智能 计算机视觉与模式识别

摘要

自然语言生成(Natural Language Generation, NLG)接受图像、视频或文本形式的数据作为输入,并生成相应的自然语言文本作为输出。现有 NLG 方法主要采用监督方法,并严重依赖耦合的数据-文本对。然而,对于许多目标场景和非英语语言,往往无法获得足够数量的标注数据。为放宽对下游任务标注数据的依赖,我们提出了一种直观且有效的零样本学习框架 ZeroNLG,它能在统一框架内处理多种 NLG 任务,包括图像到文本(图像描述)、视频到文本(视频描述)和文本到文本(神经机器翻译),并覆盖英语、中文、德语和法语。ZeroNLG 不需要任何标注的下游对进行训练。在训练期间,ZeroNLG(i)将不同域(跨模态和语言)投影到共享公共潜在空间中的相应坐标;(ii)通过对齐它们在该空间中的相应坐标来桥接不同域;(iii)构建无监督多语言自编码器,通过学习在给定共享潜在空间中坐标时重建输入文本来生成文本。因此,在推理时,基于数据到文本流程,ZeroNLG 可在给定输入数据在公共空间中坐标的情况下生成跨不同语言的目标句子。在该统一框架内,给定视觉(图像或视频)数据作为输入,ZeroNLG 可执行零样本视觉描述;给定文本句子作为输入,ZeroNLG 可执行零样本机器翻译。我们展示了在十二个 NLG 任务上的大量实验结果,表明在不使用任何标注下游对进行训练的情况下,ZeroNLG 生成高质量且可信的输出,并显著优于现有零样本方法。

关键词

引用

@article{arxiv.2303.06458,
  title  = {ZeroNLG: Aligning and Autoencoding Domains for Zero-Shot Multimodal and Multilingual Natural Language Generation},
  author = {Bang Yang and Fenglin Liu and Yuexian Zou and Xian Wu and Yaowei Wang and David A. Clifton},
  journal= {arXiv preprint arXiv:2303.06458},
  year   = {2024}
}

备注

Accepted by TPAMI (Our code and data are available at https://github.com/yangbang18/ZeroNLG)