面向视觉文档理解的测试时自适应
计算机视觉与模式识别
2023-08-25 v2 人工智能
机器学习
摘要
对于视觉文档理解(VDU),自监督预训练已证明能成功生成可迁移的表示,然而,此类表示在测试时针对分布偏移的有效自适应仍属未探索领域。我们提出 DocTTA,一种用于文档的新型测试时自适应方法,利用无标签目标文档数据进行无源域自适应。DocTTA 通过掩码视觉语言建模的跨模态自监督学习以及伪标签,将在\textit{源}域上学习的模型在测试时自适应到无标签\textit{目标}域。我们使用现有公开数据集为各种 VDU 任务引入新基准,包括实体识别、键值提取和文档视觉问答。DocTTA 相比源模型性能在这些任务上显示出显著提升,分别为(F1 分数)高达 1.89%、3.43%(F1 分数)和 17.68%(ANLS 分数)。我们的基准数据集可在 \url{https://saynaebrahimi.github.io/DocTTA.html} 获取。
引用
@article{arxiv.2206.07240,
title = {Test-Time Adaptation for Visual Document Understanding},
author = {Sayna Ebrahimi and Sercan O. Arik and Tomas Pfister},
journal= {arXiv preprint arXiv:2206.07240},
year = {2023}
}
备注
Accepted at TMLR 2023