中文

利用域外数据集增强多任务引文分析

信息检索 2022-02-23 v1 人工智能 数字图书馆

摘要

引文通常仅使用定量指标进行分析,而忽略了情感与意图等定性方面。然而,定性方面能更深入地揭示科研产物的影响力,并使人能够聚焦于相关文献,免受定量方面所带来的偏差影响。因此,可以基于情感与意图对论文进行排序与分类。为此,需要更大规模的引文情感数据集。但从时间与成本角度看,构建大规模引文情感数据集是一项具有挑战性的任务。特别是,引文情感分析面临数据稀缺与标注成本巨大的双重困境。为克服引文分析领域的数据稀缺瓶颈,我们探究了训练过程中域外数据对提升模型性能的影响。我们的结果强调了基于用例采用不同调度方法的必要性。我们通过实证发现,采用顺序数据调度训练的模型更适用于特定领域用例;反之,打乱数据喂入在跨领域任务上取得更优性能。基于我们的发现,我们提出了一种端到端可训练的多任务模型,涵盖情感与意图分析,并利用域外数据集以克服数据稀缺。

关键词

引用

@article{arxiv.2202.10884,
  title  = {Utilizing Out-Domain Datasets to Enhance Multi-Task Citation Analysis},
  author = {Dominique Mercier and Syed Tahseen Raza Rizvi and Vikas Rajashekar and Sheraz Ahmed and Andreas Dengel},
  journal= {arXiv preprint arXiv:2202.10884},
  year   = {2022}
}

备注

23 pages, 2 figures, 10 tables