PV2TEA:将视觉模态修补至基于文本建立的信息抽取
计算与语言
2023-06-05 v1 人工智能
计算机视觉与模式识别
机器学习
多媒体
摘要
信息抽取,例如属性值抽取,长期以来仅基于文本被广泛研究并形式化。然而,许多属性可从基于图像的抽取中获益,如颜色、形状、图案等。视觉模态长期未被充分利用,主要由于多模态标注困难。本文中,我们旨在将视觉模态修补至基于文本建立的属性信息抽取器。跨模态融合面临若干独特挑战:(C1) 图像与文本描述在样本内与样本间松散配对;(C2) 图像通常包含丰富背景,可能误导预测;(C3) 来自基于文本建立的抽取器的弱监督标签对多模态训练存在偏置。我们提出 PV2TEA,一种配备三种偏置消减方案的编码器-解码器架构:(S1) 增广标签平滑对比,以改善松散配对图像与文本的跨模态对齐;(S2) 注意力剪枝,自适应区分视觉前景;(S3) 两级邻域正则化,通过可靠性估计缓解标签文本偏置。在真实电商数据集上的实证结果显示,相较单模态基线 F1 绝对提升达 11.74%(相对 20.97%)。
引用
@article{arxiv.2306.01016,
title = {PV2TEA: Patching Visual Modality to Textual-Established Information Extraction},
author = {Hejie Cui and Rongmei Lin and Nasser Zalmout and Chenwei Zhang and Jingbo Shang and Carl Yang and Xian Li},
journal= {arXiv preprint arXiv:2306.01016},
year = {2023}
}
备注
ACL 2023 Findings