西班牙语中未同化借词检测:标注语料库与建模方法
计算与语言
2022-03-31 v1
摘要
本文提出一种用于借词识别的新资源,并分析了若干模型在该任务上的性能与错误。我们引入一个新的富含未同化词汇借词——即从一个语言引入另一语言而未作正字法适应的词——的西班牙语新闻专线标注语料库,并用其评估若干序列标注模型(CRF、BiLSTM-CRF及基于Transformer的模型)的表现。该语料库包含370,000个词元,比先前可用于此任务的语料库更大、借词更密集、未登录词更丰富且话题更多样。我们的结果表明,结合子词嵌入与基于Transformer的、在语码转换数据上预训练的嵌入或上下文词嵌入组合的BiLSTM-CRF模型,优于多语言BERT基模型所得结果。
引用
@article{arxiv.2203.16169,
title = {Detecting Unassimilated Borrowings in Spanish: An Annotated Corpus and Approaches to Modeling},
author = {Elena Álvarez-Mellado and Constantine Lignos},
journal= {arXiv preprint arXiv:2203.16169},
year = {2022}
}
备注
21 pages, accepted at ACL 2022