中文

基于 Transformer 的级联多模态语音翻译

计算与语言 2019-11-12 v3

摘要

本文描述了帝国理工学院为 IWSLT 2019 评测活动开发的级联多模态语音翻译系统。该架构由一个自动语音识别(ASR)系统后接一个基于 Transformer 的多模态机器翻译(MMT)系统组成。尽管 ASR 组件在各实验中相同,MMT 模型在视觉上下文集成方式(简单条件化 vs. 注意力)、所利用视觉特征类型(池化、卷积、动作类别)以及底层架构上有所不同。对于后者,我们探索了标准 transformer 及其审议(deliberation)版本,包含加性和级联变体,它们在集成文本注意力的方式上有所区别。在开展大量实验后,我们发现:(i)所探索的视觉集成方案常损害 transformer 和加性审议的翻译性能,却显著改善级联审议;(ii)如不一致性分析所示,transformer 和级联审议比加性审议更好地集成了视觉模态。

关键词

引用

@article{arxiv.1910.13215,
  title  = {Transformer-based Cascaded Multimodal Speech Translation},
  author = {Zixiu Wu and Ozan Caglayan and Julia Ive and Josiah Wang and Lucia Specia},
  journal= {arXiv preprint arXiv:1910.13215},
  year   = {2019}
}

备注

Accepted to IWSLT 2019