用于基于枢轴序列生成的相关性编码器-解码器架构
计算与语言
2016-06-16 v1
摘要
基于中间语的机器翻译(MT)旨在将多种语言编码为一种通用的语言表示,然后从该表示中解码出多种目标语言的句子。我们在神经编码器-解码器架构的背景下探索这一思想,尽管规模较小且不以机器翻译为最终目标。具体而言,我们考虑三种语言或模态 X、Z 和 Y 的情况,其中我们希望从 X 中可用的信息出发生成 Y 中的序列。然而,X 和 Y 之间没有可用的并行训练数据,但 X 与 Z 之间以及 Z 与 Y 之间存在训练数据(这在许多现实应用中很常见)。因此,Z 充当枢轴/桥梁。一种显而易见的解决方案是训练一个两阶段模型,首先从 X 转换到 Z,然后从 Z 转换到 Y,该方案可能不够优雅,但在实践中效果很好。相反,我们探索了一种受中间语启发的解决方案,该方案联合学习执行以下操作: 将 X 和 Z 编码为通用表示; 从该通用表示中解码出 Y。我们在两个任务上评估了我们的模型: 桥接音译和 桥接图像描述。我们在这两个应用中都报告了有希望的结果,并认为这是迈向真正受中间语启发的编码器-解码器架构的正确一步。
引用
@article{arxiv.1606.04754,
title = {A Correlational Encoder Decoder Architecture for Pivot Based Sequence Generation},
author = {Amrita Saha and Mitesh M. Khapra and Sarath Chandar and Janarthanan Rajendran and Kyunghyun Cho},
journal= {arXiv preprint arXiv:1606.04754},
year = {2016}
}
备注
10 pages