面向零样本 NER 的跨语言 IPA 对比学习
计算与语言
2025-03-11 v1 人工智能
摘要
针对低资源语言的零样本命名实体识别(NER),现有方法主要依赖于机器翻译,而最近的方法已将焦点转向音素表示。在此基础上,我们研究了如何缩小具有相似语音特征的语言之间在 IPA 转录中的音素表示差距,从而使在高资源语言上训练的模型能够在低资源语言上有效执行。在这项工作中,我们提出了包含 10 个英语与高资源语言 IPA 配对的 CONLIPA 数据集,这些配对来自 10 个常用语系。我们还提出了一种使用 CONLIPA 数据集的跨语言 IPA 对比学习方法(IPAC)。此外,与表现最佳的基线相比,我们提出的数据集和方法展示了显著的平均增益。
引用
@article{arxiv.2503.07214,
title = {Cross-Lingual IPA Contrastive Learning for Zero-Shot NER},
author = {Jimin Sohn and David R. Mortensen},
journal= {arXiv preprint arXiv:2503.07214},
year = {2025}
}
备注
17 pages, 6 figures