在多个数据集上微调语言模型用于引用意图分类
计算与语言
2024-10-18 v1
摘要
引用意图分类(Citation Intention Classification, CIC)工具用于对引用意图(例如背景、动机)进行分类,帮助读者评估科学文献的贡献。先前的研究表明,诸如 SciBERT 等预训练语言模型(PLMs)在 CIC 基准测试上可实现最佳性能。PLMs 通过在大型通用文本语料库上的自监督任务进行训练,能够通过对相应数据集进行适度的微调快速适应 CIC 任务。尽管存在这些优势,但在微调过程中,PLMs 可能会对小型数据集容易出现过拟合。本文提出一种多任务学习(MTL)框架,该框架在感兴趣的主要数据集上联合微调 PLMs,同时使用多个辅助 CIC 数据集,以充分利用额外的监督信号。我们开发了一种数据驱动的任务关系学习(Task Relation Learning, TRL)方法,以控制辅助数据集对微调的贡献,避免负迁移和昂贵的超参数调优。我们在三个 CIC 数据集上进行实验,表明在主要数据集上使用额外数据集进行微调可以提高 PLMs 的泛化性能。使用我们提出的框架微调的 PLMs 在小型数据集上 outperform 当前最先进的模型 7%~11%,在大型数据集上与最佳模型持平。
引用
@article{arxiv.2410.13332,
title = {Fine-Tuning Language Models on Multiple Datasets for Citation Intention Classification},
author = {Zeren Shui and Petros Karypis and Daniel S. Karls and Mingjian Wen and Saurav Manchanda and Ellad B. Tadmor and George Karypis},
journal= {arXiv preprint arXiv:2410.13332},
year = {2024}
}
备注
To be appear as a Findings paper at EMNLP 2024