面向低资源语言金融交易数据的跨语言命名实体识别
计算与语言
2023-07-19 v1
摘要
我们提出了一种用于半结构化文本数据中跨语言命名实体识别的高效建模框架。我们的方法同时依赖知识蒸馏与一致性训练。该建模框架利用在源语言上预训练的大语言模型(XLMRoBERTa)的知识,采用师生关系(知识蒸馏)。学生模型在低资源目标语言上引入无监督一致性训练(使用 KL 散度损失)。我们采用英语和阿拉伯语的两个独立 SMS 数据集,各自携带半结构化银行交易信息,并聚焦于展示从英语到阿拉伯语的知识迁移。在仅访问 30 个标注样本的情况下,我们的模型能将商户、金额及其他字段的识别从英语泛化至阿拉伯语。我们表明,与在目标语言上预训练的 DistilBERT 或直接在目标语言标注数据上训练的监督模型等最先进方法相比,我们的建模方法虽高效,但总体表现最佳。我们的实验表明,在存在少量半结构化数据标注样本的情况下,学会在英语中识别实体便足以在低资源语言中达到合理性能。所提框架对开发多语言应用具有启示意义,尤其在数字业务同时依赖英语与一种或多种低资源语言、有时与英语混合或单独使用的地区。
引用
@article{arxiv.2307.08714,
title = {Cross-Lingual NER for Financial Transaction Data in Low-Resource Languages},
author = {Sunisth Kumar and Davide Liu and Alexandre Boulenger},
journal= {arXiv preprint arXiv:2307.08714},
year = {2023}
}
备注
5 pages, 3 figures. Presented at the SIGIR 2023 Workshop on Knowledge Discovery from Unstructured Data in Financial Services (KDF)