中文

基于扩散模型的双分支提示多模态机器翻译

计算机视觉与模式识别 2025-12-05 v2 计算与语言

摘要

多模态机器翻译(MMT)通常通过纳入对齐的视觉特征来增强文本-only翻译。尽管取得了显著进展,但现有SOTA MMT方法常在推理时依赖配对的图像-文本输入,且对无关视觉噪声敏感,这限制了其鲁棒性和实际应用价值。为此,本文提出D2P-MMT,一个基于扩散模型的双分支提示框架,用于实现鲁棒的视觉引导翻译。具体而言,D2P-MMT仅需源文本和由预训练扩散模型生成的重构图像,自然过滤干扰视觉细节,同时保留语义线索。在训练阶段,模型同时从真实图像和重构图像中学习,采用双分支提示策略以促进丰富的跨模态互动。为桥接模态鸿沟并缓解训练-推理差异,本文引入分布式对齐损失,以强制两个分支输出分布的一致性。基于Multi30K数据集的大量实验表明,D2P-MMT在翻译性能方面优于现有SOTA方法。

关键词

引用

@article{arxiv.2507.17588,
  title  = {Dual-branch Prompting for Multimodal Machine Translation},
  author = {Jie Wang and Zhendong Yang and Liansong Zong and Xiaobo Zhang and Dexian Wang and Ji Zhang},
  journal= {arXiv preprint arXiv:2507.17588},
  year   = {2025}
}

备注

This manuscript is currently under review at the ACM Transactions on Multimedia Computing, Communications, and Applications