中文

基于视觉场景图剪枝的多模态机器翻译

计算机视觉与模式识别 2025-05-27 v1 机器学习

摘要

多模态机器翻译(MMT)旨在通过引入视觉信息来解决翻译任务中语言多义性和歧义带来的挑战。当前 MMT 研究的一个关键瓶颈是视觉数据的有效利用。先前的方法侧重于提取全局或区域级图像特征,并使用注意力或门控机制进行多模态信息融合。然而,这些方法并未充分解决 MMT 中视觉信息冗余的问题,也未提出有效的解决方案。在本文中,我们引入了一种新方法——基于视觉场景图剪枝(PSG)的多模态机器翻译,该方法利用语言场景图信息来指导视觉场景图中冗余节点的剪枝,从而减少下游翻译任务中的噪声。通过与 SOTA 方法的广泛对比实验和消融研究,我们证明了 PSG 模型的有效性。我们的结果还突显了视觉信息剪枝在推动 MMT 领域发展方面的巨大潜力。

关键词

引用

@article{arxiv.2505.19507,
  title  = {Multimodal Machine Translation with Visual Scene Graph Pruning},
  author = {Chenyu Lu and Shiliang Sun and Jing Zhao and Nan Zhang and Tengfei Song and Hao Yang},
  journal= {arXiv preprint arXiv:2505.19507},
  year   = {2025}
}