中文

布局感知语言模型的噪声感知训练

计算与语言 2024-04-02 v1 人工智能 机器学习

摘要

视觉富文档(VRD)利用视觉特征和语言线索来传播信息。训练一个从文档中识别命名实体的定制抽取器,需要大量在文本和视觉模态上均带有标注的目标文档类型实例。在企业场景中,我们希望以可扩展的方式为数千种不同的文档类型训练定制抽取器,而这构成了一个昂贵的瓶颈。在目标文档类型的无标注实例上预训练抽取器模型,随后在人工标注实例上进行微调,在这些场景中并不可行,因为这超出了为抽取器分配的最大允许训练时间。在本文中,我们通过提出一种噪声感知训练方法(NAT)来解决这一场景。NAT 不获取昂贵的人工标注文档,而是利用弱标注文档以可扩展的方式训练抽取器。为避免因含噪弱标注样本导致模型质量下降,NAT 估计每个训练样本的置信度,并将其作为不确定性度量纳入训练过程。我们使用 NAT 训练了多个最先进的抽取器模型。在多个公开及内部数据集上的实验表明,经 NAT 训练的模型不仅性能鲁棒——在 macro-F1 分数上比迁移学习基线高出最多 6%,而且更具标签效率——将获得可比性能所需的人力减少多达 73%。

关键词

引用

@article{arxiv.2404.00488,
  title  = {Noise-Aware Training of Layout-Aware Language Models},
  author = {Ritesh Sarkhel and Xiaoqi Ren and Lauro Beltrao Costa and Guolong Su and Vincent Perot and Yanan Xie and Emmanouil Koukoumidis and Arnab Nandi},
  journal= {arXiv preprint arXiv:2404.00488},
  year   = {2024}
}