无监督词性标注综述及其对语言习得的影响
计算与语言
2023-12-19 v1
摘要
人类句法知识的基础能力是确定哪些词可以出现在相似的结构中(即按句法类别对词进行分组)。这些分组使人类能够组合结构以传达复杂含义。一个基本问题是儿童如何获得这种句法知识基础能力。在探索这一过程时,我们将回顾各种工程方法,其目标与儿童相似——在没有先验句法知识的情况下,正确识别文本样本中单词的词性(POS)。在回顾这些无监督标注工作时,我们将讨论支持模型进步的共同主题及其与语言习得的相关性。例如,我们讨论每个模型如何判断成功(评估指标)、约束POS学习的“附加信息”(如正字法信息)以及用于确定POS的上下文(仅前一个词、目标词前后的词等)。确定的主题为未来研究支撑句法类别习得的认知过程铺平了道路,并提供了当前最先进的无监督POS标注模型的有用布局。
引用
@article{arxiv.2312.10169,
title = {Review of Unsupervised POS Tagging and Its Implications on Language Acquisition},
author = {Niels Dickson},
journal= {arXiv preprint arXiv:2312.10169},
year = {2023}
}