将超类标记特征集成到神经非连续构件解析
计算与语言
2024-10-14 v1 人工智能
形式语言与自动机理论
摘要
构成解析是自然语言处理中的关键任务,构件结构是描述语法的常用方式。传统的构件观念要求构件由相邻单词组成,但这在分析带有非局部依赖关系的语法时提出挑战,这类依赖在德语等语言中常见。因此,在德语树库(NeGra、TIGER)和英语DPTB等中,长程依赖表示为交叉边缘。各种语法形式alism已用于描述非连续树,往往伴随较高的解析复杂度。基于转换的解析旨在通过消除对显式语法的需求来降低这一因素。相反,通过在大型标注语料库上进行监督学习,训练神经网络即可对给定文本产生树。Coavoux和Cohen(2019)提出的一种优雅的无栈式基于转换的解析器成功允许在最坏情况下quadratic时间内推导给定句子的任意非连续构件树。本工作旨在探索将超类标记信息引入基于转换的非连续构件解析。在词汇化语法形式alism中如CCG,informative categories被赋予句子中单词,作为构成句子语法的构建块。这些超类标记指示单词的结构角色及其与周围项目的句法关系。本研究考察了通过使用专门的超类标记器作为额外输入训练神经解析器(管道方法)以及通过联合训练神经模型进行解析和超类标记(多任务方法)来集成超类标记信息。除了CCG,还将比较几种其他框架(LTAG-spinal、LCFRS)和序列标注任务(块标记、依存解析)在作为解析的辅助任务方面的适用性。
引用
@article{arxiv.2410.08766,
title = {Integrating Supertag Features into Neural Discontinuous Constituent Parsing},
author = {Lukas Mielczarek},
journal= {arXiv preprint arXiv:2410.08766},
year = {2024}
}
备注
Bachelor's Thesis. Supervised by Dr. Kilian Evang and Univ.-Prof. Dr. Laura Kallmeyer