面向富视觉文档实体检索的任务个性化多模态少样本学习
人工智能
2023-12-12 v2
摘要
富视觉文档实体检索(VDER)从发票、收据等文档图像中提取日期、地址等关键信息,已成为工业 NLP 应用中的重要课题。新型文档类型以恒定速度涌现,每种各具独特实体类型,这带来一项独特挑战:许多文档包含仅出现极少次数的未见实体类型。应对该挑战要求模型具备少样本学习实体的能力。然而,既往少样本 VDER 工作主要在文档层面以预定义全局实体空间解决问题,未考虑实体级少样本场景:目标实体类型由每个任务局部个性化,且实体出现在各文档间差异显著。为应对这一未被探索的场景,本文研究一种新颖的实体级少样本 VDER 任务。其挑战在于每个任务标签空间的独特性以及分布外(OOD)内容复杂度的增加。为攻克该新任务,我们提出一种基于任务感知元学习的框架,核心在于实现区分任务内与任务外分布的有效任务个性化。具体而言,我们采用分层解码器(HC)并运用对比学习(ContrastProtoNet)达成此目标。此外,我们引入新数据集 FewVEX 以推动实体级少样本 VDER 领域的未来研究。实验结果表明,我们的方法显著提升了流行元学习基线的鲁棒性。
引用
@article{arxiv.2311.00693,
title = {On Task-personalized Multimodal Few-shot Learning for Visually-rich Document Entity Retrieval},
author = {Jiayi Chen and Hanjun Dai and Bo Dai and Aidong Zhang and Wei Wei},
journal= {arXiv preprint arXiv:2311.00693},
year = {2023}
}
备注
Paper published at Findings of the Association for Computational Linguistics: EMNLP, 2023