中文

用于跨域文本分类的跨域标注 LDA

计算与语言 2019-01-07 v1

摘要

跨域文本分类旨在利用源域和目标域的数据为目标域构建分类器。一个很有前景的思路是最小化两域的特征分布差异。大多数现有研究通过精确对齐机制(如一对一特征对齐、投影矩阵等)显式最小化此类差异。然而,当不同域的语义分布差异很大时,这种精确对齐会限制模型的学习能力,并进一步损害模型在分类任务上的性能。为解决该问题,我们提出一种新颖的组对齐,在组级别对齐语义。此外,为帮助模型学习更好的语义组及组内语义,我们还对模型在源域的学习提出部分监督。为此,我们将组对齐与部分监督嵌入到一个跨域主题模型中,并提出跨域标注 LDA(CDL-LDA)。在标准的 20Newsgroup 和 Reuters 数据集上,我们进行了广泛的定量(分类、困惑度等)与定性(主题检测)实验,以展示所提组对齐与部分监督的有效性。

关键词

引用

@article{arxiv.1809.05820,
  title  = {Cross-Domain Labeled LDA for Cross-Domain Text Classification},
  author = {Baoyu Jing and Chenwei Lu and Deqing Wang and Fuzhen Zhuang and Cheng Niu},
  journal= {arXiv preprint arXiv:1809.05820},
  year   = {2019}
}

备注

ICDM 2018