中文

MIST:英语科学文本中情态动词功能的规模化标注资源与神经模型

计算与语言 2022-12-15 v1 人工智能

摘要

情态动词(如 "can"、"should" 或 "must")在科学文章中出现的频率极高。解读其功能并不简单:它们常用于模糊限制,但也可能表示能力与限制。理解其含义对于写作辅助或从科学文本中准确抽取信息等各类 NLP 任务十分重要。为促进对该体裁中情态动词用法的研究,我们引入了 MIST(科学文本中的情态动词,Modals In Scientific Text)数据集,其包含五个科学领域中 3737 个标注了语义、语用或修辞功能的情态动词实例。我们在 MIST 上系统评估了一系列有竞争力的神经架构。迁移实验表明,利用非科学数据对建模 MIST 中的区分益处有限。我们的语料分析提供的证据表明,科学共同体在情态动词使用上存在差异,但训练于科学数据的分类器在某种程度上可泛化至未见的科学领域。

关键词

引用

@article{arxiv.2212.07156,
  title  = {MIST: a Large-Scale Annotated Resource and Neural Models for Functions of Modal Verbs in English Scientific Text},
  author = {Sophie Henning and Nicole Macher and Stefan Grünewald and Annemarie Friedrich},
  journal= {arXiv preprint arXiv:2212.07156},
  year   = {2022}
}

备注

20 pages, 7 figures. Accepted to EMNLP Findings 2022; typesetting of this version slightly differs from conference version