中文

RegCLR:一种面向真实场景表格表征学习的自监督框架

计算机视觉与模式识别 2022-11-03 v1 机器学习

摘要

近期,利用大型模型从自然图像中学习视觉表征的自监督学习(SSL)进展,正在快速缩小下游视觉任务中全监督学习与SSL所得结果之间的差距。受此进展启发,并主要源于表格及结构化文档图像应用的出现,我们研究了哪些自监督预训练目标、架构和微调策略最为有效。为解答这些问题,我们引入了RegCLR,一种结合对比与正则化方法且与标准Vision Transformer架构兼容的新自监督框架。随后,以掩码自编码器作为对比方法的代表、以增强的Barlow Twins作为正则化方法的代表,并在两个分支中配置可变的输入图像增强,对RegCLR进行实例化。若干真实世界的表格识别场景(例如从文档图像中提取表格),从标准的Word和Latex文档到更具挑战性的电子健康记录(EHR)计算机屏幕图像,均已表明可从该新框架学到的表征中大幅获益:在真实世界EHR屏幕图像上,相较此前的全监督基线,表格检测平均精度(AP)相对提升4.8%,列相对提升11.8%,GUI对象相对提升11.1%。

关键词

引用

@article{arxiv.2211.01165,
  title  = {RegCLR: A Self-Supervised Framework for Tabular Representation Learning in the Wild},
  author = {Weiyao Wang and Byung-Hak Kim and Varun Ganapathi},
  journal= {arXiv preprint arXiv:2211.01165},
  year   = {2022}
}

备注

To be presented at the 36th Conference on Neural Information Processing Systems, New Orleans, USA, on December 2, 2022, at the First Table Representation Learning (TRL) Workshop