中文

无监督词性标注综述及其对语言习得的影响

计算与语言 2023-12-19 v1

摘要

人类句法知识的基础能力是确定哪些词可以出现在相似的结构中(即按句法类别对词进行分组)。这些分组使人类能够组合结构以传达复杂含义。一个基本问题是儿童如何获得这种句法知识基础能力。在探索这一过程时,我们将回顾各种工程方法,其目标与儿童相似——在没有先验句法知识的情况下,正确识别文本样本中单词的词性(POS)。在回顾这些无监督标注工作时,我们将讨论支持模型进步的共同主题及其与语言习得的相关性。例如,我们讨论每个模型如何判断成功(评估指标)、约束POS学习的“附加信息”(如正字法信息)以及用于确定POS的上下文(仅前一个词、目标词前后的词等)。确定的主题为未来研究支撑句法类别习得的认知过程铺平了道路,并提供了当前最先进的无监督POS标注模型的有用布局。

关键词

引用

@article{arxiv.2312.10169,
  title  = {Review of Unsupervised POS Tagging and Its Implications on Language Acquisition},
  author = {Niels Dickson},
  journal= {arXiv preprint arXiv:2312.10169},
  year   = {2023}
}