中文

面向关系抽取的单模态与多模态表示训练

计算与语言 2022-11-23 v1

摘要

文本、版面和视觉信息的多模态融合在视觉丰富文档理解(VrDU)任务(包括关系抽取(RE))中已取得 SOTA 结果。然而,尽管这些模态十分重要,对其相对预测能力的评估却较为少见。在此,我们通过训练时迭代排除每种数据类型进行实验,展示了共享表示对 RE 任务的价值。此外,我们还单独评估了文本和版面数据。虽然双模态的文本与版面方法表现最佳(F1=0.684),但我们表明文本是实体关系最重要的单一预测因子。此外,版面几何结构具有高度预测性,甚至可作为一种可行的单模态方法。尽管视觉效果较差,我们仍强调了视觉信息可提升性能的情形。总体而言,我们的结果证明了为 RE 训练联合表示的有效性。

关键词

引用

@article{arxiv.2211.06168,
  title  = {Unimodal and Multimodal Representation Training for Relation Extraction},
  author = {Ciaran Cooney and Rachel Heyburn and Liam Madigan and Mairead O'Cuinn and Chloe Thompson and Joana Cavadas},
  journal= {arXiv preprint arXiv:2211.06168},
  year   = {2022}
}

备注

11 pages, 3 figures, 30th Irish Conference on Artificial Intelligence and Cognitive Science