中文

多模态关系抽取中合成数据训练效果优于真实数据

人工智能 2023-12-07 v1 计算与语言 计算机视觉与模式识别 机器学习

摘要

多模态关系抽取任务已引起广泛的研究关注,但其进展受到可用训练数据稀缺的制约。一个自然的想法是利用跨模态生成模型扩展现有数据集。本文考虑了一个新颖的问题设定:在训练期间仅能获得单模态数据(文本或图像)。我们的目标是利用合成数据训练一个多模态分类器,使其在真实的多模态测试数据上表现良好。然而,使用合成数据进行训练面临两个障碍:缺乏数据多样性和标签信息丢失。为了缓解这些问题,我们提出了互信息感知的多模态迭代关系数据生成方法(MI2RAGE),该方法应用链式跨模态生成(CCG)来提升生成数据的多样性,并利用一个教师网络筛选出与真实标签具有高互信息的有价值训练样本。将我们的方法与直接在合成数据上训练相比,使用合成文本时F1值显著提升了24.06%,使用合成图像时F1值提升了26.42%。值得注意的是,我们完全在合成图像上训练的最佳模型,其F1值比之前在真实多模态数据上训练的最先进模型高出3.76%。我们的代码库将在论文被接收后公开。

关键词

引用

@article{arxiv.2312.03025,
  title  = {Training on Synthetic Data Beats Real Data in Multimodal Relation Extraction},
  author = {Zilin Du and Haoxin Li and Xu Guo and Boyang Li},
  journal= {arXiv preprint arXiv:2312.03025},
  year   = {2023}
}