中文

面向跨域度量、单位与上下文抽取的多源(预)训练

计算与语言 2023-08-08 v1

摘要

我们提出了一种基于预训练语言模型的跨域自动度量与上下文抽取方法。我们构建了一个多源、多领域的语料库,并训练了一个端到端的抽取流水线。随后,我们应用多源任务自适应预训练与微调,以评测我们模型的跨域泛化能力。此外,我们概念化并应用了一种任务特定的错误分析,并得出对后续工作的见解。我们的结果表明,多源训练带来了最佳的总体结果,而单源训练在各自单独领域上取得了最佳结果。尽管我们的设置在抽取数量值与单位方面表现成功,但仍需更多研究以改进上下文实体的抽取。我们将本工作中使用的跨域语料库在线公开。

关键词

引用

@article{arxiv.2308.02951,
  title  = {Multi-Source (Pre-)Training for Cross-Domain Measurement, Unit and Context Extraction},
  author = {Yueling Li and Sebastian Martschat and Simone Paolo Ponzetto},
  journal= {arXiv preprint arXiv:2308.02951},
  year   = {2023}
}

备注

Published as a workshop paper at BioNLP 2023