中文

通过多任务学习解决科学信息抽取中的标签变异问题

计算与语言 2023-12-27 v1

摘要

科学信息抽取(ScientificIE)是一项关键任务,涉及识别科学实体及其关系。该任务的复杂性因需要领域特定知识和标注数据有限而加剧。ScientificIE最流行的两个数据集是SemEval-2018 Task-7和SciERC。它们有重叠样本,但标注方案不同,导致冲突。在本研究中,我们首先引入了一种基于多任务学习的新方法来解决标签变异问题。然后,我们提出了一种软标签技术,将不一致的标签转换为概率分布。实验结果表明,所提出的方法可以增强模型对标签噪声的鲁棒性,并提高两个ScientificIE任务的端到端性能。分析表明,标签变异在处理模糊实例时特别有效。此外,标签变异捕获的信息丰富性可能减少数据量需求。研究结果强调了发布变异标签的重要性,并促进了其他领域其他任务的未来研究。总体而言,本研究展示了多任务学习的有效性以及标签变异在提升ScientificIE性能方面的潜力。

关键词

引用

@article{arxiv.2312.15751,
  title  = {Solving Label Variation in Scientific Information Extraction via Multi-Task Learning},
  author = {Dong Pham and Xanh Ho and Quang-Thuy Ha and Akiko Aizawa},
  journal= {arXiv preprint arXiv:2312.15751},
  year   = {2023}
}

备注

14 pages, 7 figures, PACLIC 37