中文

基于图-文自监督训练的多模态预训练模型泛化算法

计算与语言 2023-02-22 v1 人工智能

摘要

近来大量研究表明,引入视觉信息可有效改善神经机器翻译(NMT)的效果。其有效性很大程度上取决于大量双语平行句对与人工图像标注的可获得性。图像缺失与图像有效性难以解决。本文提出一种用于自监督训练的多模态预训练泛化算法,克服了视觉信息缺失与不准确的问题,从而扩展了图像在NMT上的适用性。具体而言,我们将通过搜索引擎从现有句子中检索多张图片,然后借助视觉信息与文本间的关系,执行图文自监督训练任务,为文本获取更有效的视觉信息。我们表明,当经筛选的信息用作多模态机器翻译微调时,全局语音数据集上的翻译效果较基线高出0.5 BLEU。

关键词

引用

@article{arxiv.2302.10315,
  title  = {Generalization algorithm of multimodal pre-training model based on graph-text self-supervised training},
  author = {Zhangxiaobing and Tangzhenhao and Longzi and Fuxianghua},
  journal= {arXiv preprint arXiv:2302.10315},
  year   = {2023}
}