中文

利用枢轴稳定化实现面向网络规模语言覆盖的跨模态语言生成

计算与语言 2020-05-04 v1 计算机视觉与模式识别 机器学习

摘要

诸如图像描述之类的跨模态语言生成任务,因数据饥渴模型趋势与非英语标注的缺乏,其在支持非英语语言方面的能力直接受损。我们研究将现有英语语言生成标注与翻译能力相结合的潜在方案,以在领域与语言覆盖上创建网络规模的解决方案。我们描述了一种称为枢轴语言生成稳定化(PLuGS)的方法,它在训练时直接利用现有英语标注(金数据)及其机器翻译版本(银数据);在运行时,它先生成英语描述,再生成相应的目标语言描述。我们表明,在基于 Open Images 数据集图像的大领域测试集上,对 5 种不同目标语言的评估中,PLuGS 模型优于其他候选方案。此外,我们发现一个有趣的现象:PLuGS 模型生成的英语描述优于原始单语英语模型生成的描述。

关键词

引用

@article{arxiv.2005.00246,
  title  = {Cross-modal Language Generation using Pivot Stabilization for Web-scale Language Coverage},
  author = {Ashish V. Thapliyal and Radu Soricut},
  journal= {arXiv preprint arXiv:2005.00246},
  year   = {2020}
}

备注

ACL 2020