中文

面向自然语言摘要的去噪序列到序列模型的领域特定微调

计算与语言 2022-04-22 v1 人工智能

摘要

长文本数据摘要是一个在医学和金融等知识经济职业中尤为突出的问题,这些领域需要持续了解复杂且不断演进的知识体系。因此,利用自然语言处理(NLP)技术自动隔离并摘要关键内容,有望为这些行业节省大量时间。我们探索了最先进NLP模型(BART)的应用,并研究了使用数据增强与多种微调策略将其调优至最佳性能的策略。我们表明,在领域特定数据上测试时,我们的端到端微调方法相比开箱即用的预训练BART摘要器可带来5-6%的绝对ROUGE-1提升,并公开了我们在金融、医疗或其他用户指定领域取得这些结果的端到端流程。

关键词

引用

@article{arxiv.2204.09716,
  title  = {Domain Specific Fine-tuning of Denoising Sequence-to-Sequence Models for Natural Language Summarization},
  author = {Brydon Parker and Alik Sokolov and Mahtab Ahmed and Matt Kalebic and Sedef Akinli Kocak and Ofer Shai},
  journal= {arXiv preprint arXiv:2204.09716},
  year   = {2022}
}

备注

8 pages, 6 figures