中文

广义漏斗法:集成学习与异构文档嵌入用于跨语言文本分类

计算与语言 2022-02-09 v2 机器学习

摘要

漏斗法(Funnelling, Fun)是近期提出的一种基于异构迁移学习(HTL)双层学习集成机制的跨语言文本分类(CLTC)方法。在该集成方法中,第一层分类器各自工作于不同且依赖于语言的特征空间,为每篇文档返回一个经校准的后验概率向量(每一维对应一个类别),最终分类决策由以该向量为输入的元分类器作出。元分类器因而可利用类间相关性,这一点(除其他外)使Fun优于那些无法利用此类相关性的CLTC系统。本文描述广义漏斗法(Generalized Funnelling, gFun),它是Fun的一种推广,由一种HTL架构组成,其中第一层组件可以是任意视图生成函数(view-generating functions),即各自产生(单语)文档的语言无关表示(“视图”)的依赖于语言的函数。我们描述gFun的一个实例,其中元分类器接收作为输入的一个经校准的后验概率向量(如Fun中那样)聚合了其他体现其他类型相关性的嵌入表示,如词-类相关性(由词-类嵌入(Word-Class Embeddings)编码)、词-词相关性(由多语言无监督或有监督嵌入(Multilingual Unsupervised or Supervised Embeddings)编码)以及词-上下文相关性(由多语言BERT(multilingual BERT)编码)。我们通过在两个大型标准多语言多标签文本分类数据集上报告的实验结果,表明该gFun实例显著优于Fun及最先进的基线方法。我们实现gFun的代码已公开可用。

关键词

引用

@article{arxiv.2110.14764,
  title  = {Generalized Funnelling: Ensemble Learning and Heterogeneous Document Embeddings for Cross-Lingual Text Classification},
  author = {Alejandro Moreo and Andrea Pedrotti and Fabrizio Sebastiani},
  journal= {arXiv preprint arXiv:2110.14764},
  year   = {2022}
}