以场景图为枢轴:基于视觉场景幻觉的推理时无图像无监督多模态机器翻译
计算与语言
2023-05-26 v2
摘要
在本工作中,我们研究一种更现实的无监督多模态机器翻译(UMMT)设定:推理时无图像 UMMT,其中模型以源文本-图像对进行训练,且仅以源文本输入进行测试。首先,我们用视觉与语言场景图(SG)表示输入图像与文本,此类细粒度视觉-语言特征确保对语义的整体理解。为在推理时实现纯文本输入,我们设计了一种视觉场景幻觉机制,从给定文本 SG 动态生成伪视觉 SG。我们引入了若干基于 SG 枢轴的学习目标用于无监督翻译训练。在基准 Multi30K 数据上,我们的基于 SG 的方法在该任务与设定上以显著 BLEU 分数优于最佳基线,无需依赖配对图像即可生成具有更好完整性、相关性与流畅性的翻译。进一步的深入分析揭示了我们的模型如何在该任务设定中取得进展。
引用
@article{arxiv.2305.12256,
title = {Scene Graph as Pivoting: Inference-time Image-free Unsupervised Multimodal Machine Translation with Visual Scene Hallucination},
author = {Hao Fei and Qian Liu and Meishan Zhang and Min Zhang and Tat-Seng Chua},
journal= {arXiv preprint arXiv:2305.12256},
year = {2023}
}
备注
ACL 2023