中文

面向法律与生物医学文本多标签分类的编码器-解码器方法探索

计算与语言 2023-05-10 v1

摘要

标准的多标签文本分类方法很大程度上依赖仅编码器的预训练语言模型,而编码器-解码器模型已在其他分类任务中被证明更为有效。在本研究中,我们比较四种多标签分类方法:两种基于仅编码器,两种基于编码器-解码器。我们在四个数据集上开展实验——两个属于法律领域,两个属于生物医学领域,每个数据集具有两种标签粒度——并始终从同一预训练模型 T5 出发。我们的结果表明,编码器-解码器方法优于仅编码器方法,且在更复杂的数据集与更细粒度的标注方案上优势渐增。特别地,以非自回归方式使用编码器-解码器模型取得了总体最佳性能,因此我们进一步通过消融实验研究该方法以更好理解其优势。

关键词

引用

@article{arxiv.2305.05627,
  title  = {An Exploration of Encoder-Decoder Approaches to Multi-Label Classification for Legal and Biomedical Text},
  author = {Yova Kementchedjhieva and Ilias Chalkidis},
  journal= {arXiv preprint arXiv:2305.05627},
  year   = {2023}
}

备注

9 pages, long paper at ACL 2023 Findings