标注、复制或预测:一种基于序列的视觉信息抽取统一弱监督学习框架
计算机视觉与模式识别
2021-06-22 v1 人工智能
信息检索
机器学习
多媒体
摘要
视觉信息抽取 (VIE) 近年来受到越来越多的关注。现有方法通常先将光学字符识别 (OCR) 结果整理为纯文本,再利用词元级实体标注作为监督来训练序列标注模型。然而,这耗费大量标注成本,且可能面临标签混淆,OCR 错误也会显著影响最终性能。本文提出一种称为 TCPN (标注、复制或预测网络) 的统一弱监督学习框架,其引入 1) 一种高效编码器,在 2D OCR 结果中同时建模语义与版式信息;2) 一种仅使用关键信息序列作为监督的弱监督训练策略;以及 3) 一个灵活可切换的解码器,包含两种推理模式:其一 (复制或预测模式) 在每个时间步通过从输入复制词元或预测一个词元来输出不同类别的关键信息序列,其二 (标注模式) 在单次前向传播中直接标注输入序列。我们的方法在多个公开基准上取得了新的 SOTA 性能,充分证明了其有效性。
引用
@article{arxiv.2106.10681,
title = {Tag, Copy or Predict: A Unified Weakly-Supervised Learning Framework for Visual Information Extraction using Sequences},
author = {Jiapeng Wang and Tianwei Wang and Guozhi Tang and Lianwen Jin and Weihong Ma and Kai Ding and Yichao Huang},
journal= {arXiv preprint arXiv:2106.10681},
year = {2021}
}
备注
IJCAI2021