中文

将事件抽取器适配至医学数据:弥合协变量偏移

计算与语言 2020-08-24 v1

摘要

我们致力于在无标注数据的情况下,通过将源域与目标域的边际分布对齐,将事件抽取器适配到新领域。作为测试平台,我们利用来自两个医学领域的英文文本创建了两个新的事件抽取数据集:(i) 临床笔记,以及 (ii) 医患对话。我们测试了三种边际对齐技术的有效性:(i) 对抗域适配(ADA),(ii) 域自适应微调(DAFT),以及 (iii) 一种基于语言模型似然分数的新型实例加权技术(LIW)。在这两个领域上,LIW 和 DAFT 均优于无迁移的 BERT 基线,但 ADA 仅在临床笔记上有所提升。对不同类型偏移(例如词汇偏移、语义偏移)下性能的深入分析揭示了模型间有趣的差异。我们的性能最佳模型在笔记和对话上分别达到了 70.0 和 72.9 的 F1 分数,且未使用来自目标领域的任何标注数据。

关键词

引用

@article{arxiv.2008.09266,
  title  = {Adapting Event Extractors to Medical Data: Bridging the Covariate Shift},
  author = {Aakanksha Naik and Jill Lehman and Carolyn Rose},
  journal= {arXiv preprint arXiv:2008.09266},
  year   = {2020}
}