面向视觉丰富文档的跨模态实体匹配
机器学习
2024-04-02 v2 数据库
信息检索
摘要
视觉丰富文档(如传单、横幅、杂志文章)是利用视觉线索增强其语义的物理或数字文档。这些文档所含信息具有临时性且常不完整。现有支持此类文档结构化查询的工作未考虑这一点,导致难以对从这些文档查询所得信息进行语境化并从中获取可操作的洞察。我们提出Juno——一个跨模态实体匹配框架以解决该局限。它通过将文档中的文本片段与外部数据库中语义相似的元组相匹配,用补充信息增强异构文档。我们的主要贡献是一个带注意力的深度神经网络,其超越传统基于关键词的匹配,通过在多模态编码空间上对齐文本片段与关系元组来寻找匹配元组,而无需关于文档类型或底层模式的先验知识。在多个真实世界数据集上的详尽实验表明,Juno可泛化至具有多样布局与格式的异构文档。它以超过6个F1点的优势超越SOTA基线,且所需人工标注样本最多减少60%。我们的实验进一步表明Juno是一个计算上鲁棒的框架。我们只需训练一次,便可针对多种资源受限环境动态适配而不牺牲其下游性能,这使其适用于各类边缘设备上的端侧部署。据我们所知,我们的工作是首个研究视觉丰富文档信息不完整性、并提出以端到端方式解决该问题的可泛化、高性能且计算鲁棒框架的工作。
引用
@article{arxiv.2303.00720,
title = {Cross-Modal Entity Matching for Visually Rich Documents},
author = {Ritesh Sarkhel and Arnab Nandi},
journal= {arXiv preprint arXiv:2303.00720},
year = {2024}
}