中文

监督在无监督成分句法分析中的作用

计算与语言 2020-10-08 v2

摘要

我们分析了几种近期的无监督成分句法分析模型,这些模型在 Wall Street Journal (WSJ) 开发集(1,700 个句子)上依据句法分析 F1F_1 分数进行调参。我们为它们引入了强基线:在相同可获取的标注样本上训练一个已有的有监督句法分析模型(Kitaev and Klein, 2018)。当在 1,700 个样本上训练时,甚至仅使用 50 个样本训练、5 个样本开发时,这种少样本句法分析方法都能以显著优势超越所有无监督句法分析方法。少样本句法分析还可通过简单的数据增强方法和自训练进一步提升。这表明,为得出公平结论,我们应仔细考量用于模型开发的标注数据量。我们为未来的无监督句法分析工作提出两项协议:(i)使用完全无监督的准则进行超参数调优与模型选择;(ii)尽可能少地使用标注样本进行模型开发,并与在相同标注样本上训练的少样本句法分析进行比较。

关键词

引用

@article{arxiv.2010.02423,
  title  = {On the Role of Supervision in Unsupervised Constituency Parsing},
  author = {Haoyue Shi and Karen Livescu and Kevin Gimpel},
  journal= {arXiv preprint arXiv:2010.02423},
  year   = {2020}
}

备注

EMNLP 2020. Project page: https://ttic.uchicago.edu/~freda/project/rsucp/