用于无监督句法探测的文本表示深度聚类
计算与语言
2021-12-03 v2
摘要
我们探索文本表示的深度聚类,用于无监督模型解释与句法归纳。由于这些表示是高维的,像KMeans这样的开箱即用方法效果不佳。因此,我们的方法将表示联合变换到低维且利于聚类的空间并对其进行聚类。我们在本工作中考虑两种句法概念:词性归纳(POSI)与成分句法标注(CoLab)。有趣的是,我们发现多语言BERT(mBERT)包含惊人数量的英语句法知识;可能甚至与英语BERT(EBERT)一样多。我们的模型可用作无监督探针,这可以说是一种偏差更小的探测方式。我们发现无监督探针比有监督探针更受益于更高层。我们进一步注意到,我们的无监督探针对EBERT和mBERT表示的利用方式不同,尤其在POSI上。我们通过展示其作为无监督句法归纳技术的能力来验证探针的有效性。我们的探针只需适配输入表示即可适用于两种句法形式。我们在45标签英语POSI上报告了具有竞争力的性能,在10种语言上的12标签POSI上达到最先进性能,并在CoLab上取得有竞争力的结果。我们还在资源匮乏语言上进行了零样本句法归纳并报告了强劲结果。
引用
@article{arxiv.2010.12784,
title = {Deep Clustering of Text Representations for Supervision-free Probing of Syntax},
author = {Vikram Gupta and Haoyue Shi and Kevin Gimpel and Mrinmaya Sachan},
journal= {arXiv preprint arXiv:2010.12784},
year = {2021}
}