通过多任务学习解决科学信息抽取中的标签变异问题
计算与语言
2023-12-27 v1
摘要
科学信息抽取(ScientificIE)是一项关键任务,涉及识别科学实体及其关系。该任务的复杂性因需要领域特定知识和标注数据有限而加剧。ScientificIE最流行的两个数据集是SemEval-2018 Task-7和SciERC。它们有重叠样本,但标注方案不同,导致冲突。在本研究中,我们首先引入了一种基于多任务学习的新方法来解决标签变异问题。然后,我们提出了一种软标签技术,将不一致的标签转换为概率分布。实验结果表明,所提出的方法可以增强模型对标签噪声的鲁棒性,并提高两个ScientificIE任务的端到端性能。分析表明,标签变异在处理模糊实例时特别有效。此外,标签变异捕获的信息丰富性可能减少数据量需求。研究结果强调了发布变异标签的重要性,并促进了其他领域其他任务的未来研究。总体而言,本研究展示了多任务学习的有效性以及标签变异在提升ScientificIE性能方面的潜力。
引用
@article{arxiv.2312.15751,
title = {Solving Label Variation in Scientific Information Extraction via Multi-Task Learning},
author = {Dong Pham and Xanh Ho and Quang-Thuy Ha and Akiko Aizawa},
journal= {arXiv preprint arXiv:2312.15751},
year = {2023}
}
备注
14 pages, 7 figures, PACLIC 37