利用枢轴稳定化实现面向网络规模语言覆盖的跨模态语言生成
计算与语言
2020-05-04 v1 计算机视觉与模式识别
机器学习
摘要
诸如图像描述之类的跨模态语言生成任务,因数据饥渴模型趋势与非英语标注的缺乏,其在支持非英语语言方面的能力直接受损。我们研究将现有英语语言生成标注与翻译能力相结合的潜在方案,以在领域与语言覆盖上创建网络规模的解决方案。我们描述了一种称为枢轴语言生成稳定化(PLuGS)的方法,它在训练时直接利用现有英语标注(金数据)及其机器翻译版本(银数据);在运行时,它先生成英语描述,再生成相应的目标语言描述。我们表明,在基于 Open Images 数据集图像的大领域测试集上,对 5 种不同目标语言的评估中,PLuGS 模型优于其他候选方案。此外,我们发现一个有趣的现象:PLuGS 模型生成的英语描述优于原始单语英语模型生成的描述。
引用
@article{arxiv.2005.00246,
title = {Cross-modal Language Generation using Pivot Stabilization for Web-scale Language Coverage},
author = {Ashish V. Thapliyal and Radu Soricut},
journal= {arXiv preprint arXiv:2005.00246},
year = {2020}
}
备注
ACL 2020