中文

文本的无监督表示解耦:基于合成数据集的评估

计算与语言 2021-06-08 v1

摘要

为凸显无监督设定下文本领域实现表示解耦的挑战,本文从图像领域选取了一组成功应用的代表性模型。我们在 6 个解耦指标以及下游分类任务与同伦上对这些模型进行评估。为便于评估,我们提出了两个具有已知生成因子的合成数据集。我们的实验凸显了文本领域现有的差距,并说明诸如表示稀疏性(作为归纳偏置)或与解码器的表示耦合等某些因素会影响解耦。据我们所知,我们的工作是无监督表示解耦与文本交叉方向的首次尝试,并为考察该方向的未来发展提供了实验框架与数据集。

关键词

引用

@article{arxiv.2106.03631,
  title  = {Unsupervised Representation Disentanglement of Text: An Evaluation on Synthetic Datasets},
  author = {Lan Zhang and Victor Prokhorov and Ehsan Shareghi},
  journal= {arXiv preprint arXiv:2106.03631},
  year   = {2021}
}

备注

Accepted to RepL4NLP 2021