从头训练 LayoutLM 以实现保险领域高效命名实体识别
计算与语言
2024-12-13 v1
摘要
通用预训练神经网络在金融和保险等专业领域可能难以产生良好结果。这是由于训练数据与下游任务之间的领域不匹配导致的,由于隐私限制,领域内数据往往稀缺。本文比较了不同的 LayoutLM 预训练策略。我们表明,使用与领域相关的文档可提高使用 novel 数据集 Payslips(用于匿名化保险相关财务文件)进行命名实体识别(NER)问题上的结果。此外,我们表明可以使用更小更快的模型实现竞争性结果。
引用
@article{arxiv.2412.09341,
title = {Training LayoutLM from Scratch for Efficient Named-Entity Recognition in the Insurance Domain},
author = {Benno Uthayasooriyar and Antoine Ly and Franck Vermet and Caio Corro},
journal= {arXiv preprint arXiv:2412.09341},
year = {2024}
}
备注
Coling 2025 workshop (FinNLP)