预测动作以辅助预测翻译
计算与语言
2019-08-20 v2
摘要
我们在 How2 数据集上采用最先进的基于 transformer 的多模态方法处理文本翻译任务。我们探讨的问题是视觉特征是否能够支持翻译过程,特别是鉴于该数据集提取自视频,我们关注动作的翻译,我们认为在当前用于多模态翻译的静态图文数据集中,动作未被充分刻画。为此,我们从视频中提取不同类型的动作特征,并通过测试在与 (i) 原始文本以及 (ii) 屏蔽掉动作相关词(或所有动词)的原始文本结合使用时,其能否提升翻译质量,来仔细考察这些视觉信息的帮助程度。后者是一种模拟,有助于我们在文本未提供足够动作上下文或输入文本存在噪声的情况下评估图像的效用。
引用
@article{arxiv.1908.01665,
title = {Predicting Actions to Help Predict Translations},
author = {Zixiu Wu and Julia Ive and Josiah Wang and Pranava Madhyastha and Lucia Specia},
journal= {arXiv preprint arXiv:1908.01665},
year = {2019}
}
备注
Accepted to workshop "The How2 Challenge: New Tasks for Vision & Language" of International Conference on Machine Learning 2019