面向关系抽取的单模态与多模态表示训练
计算与语言
2022-11-23 v1
摘要
文本、版面和视觉信息的多模态融合在视觉丰富文档理解(VrDU)任务(包括关系抽取(RE))中已取得 SOTA 结果。然而,尽管这些模态十分重要,对其相对预测能力的评估却较为少见。在此,我们通过训练时迭代排除每种数据类型进行实验,展示了共享表示对 RE 任务的价值。此外,我们还单独评估了文本和版面数据。虽然双模态的文本与版面方法表现最佳(F1=0.684),但我们表明文本是实体关系最重要的单一预测因子。此外,版面几何结构具有高度预测性,甚至可作为一种可行的单模态方法。尽管视觉效果较差,我们仍强调了视觉信息可提升性能的情形。总体而言,我们的结果证明了为 RE 训练联合表示的有效性。
引用
@article{arxiv.2211.06168,
title = {Unimodal and Multimodal Representation Training for Relation Extraction},
author = {Ciaran Cooney and Rachel Heyburn and Liam Madigan and Mairead O'Cuinn and Chloe Thompson and Joana Cavadas},
journal= {arXiv preprint arXiv:2211.06168},
year = {2022}
}
备注
11 pages, 3 figures, 30th Irish Conference on Artificial Intelligence and Cognitive Science