基于预训练语言模型的跨领域双语词典归纳
计算与语言
2025-05-30 v1
摘要
双语词典归纳 (BLI) 通常基于共域数据获取单语词嵌入,并通过对齐单语词嵌入获得跨语言嵌入,进而用于获取词翻译对。在本文中,我们提出了一项新的 BLI 任务,即利用通用领域和目标领域的单语语料库提取特定领域的双语词典。受预训练模型能力的启发,我们提出了一种基于近期 BLI 研究以获取更好词嵌入的方法。在此过程中,我们首次在跨领域 BLI 任务中引入了 Code Switch (Qin et al., 2020),然而这些方法是否适用于专业领域的双语词典提取尚有待观察。如表 1 所示,经典且高效的 BLI 方法 Muse 和 Vecmap 在医学数据集上的表现远差于在 Wiki 数据集上的表现。一方面,特定领域数据集通常比通用领域数据集相对较小,且专业词汇频率较低,这将直接影响双语词典的翻译质量。另一方面,静态词嵌入广泛用于 BLI,然而在某些特定领域,词义受上下文影响极大,在这种情况下,仅使用静态词嵌入可能会导致较大偏差。Code Switch 能够在不同上下文中匹配不同策略,使模型更适合此任务。实验结果表明,我们的方法在三个特定领域上能够提升稳健 BLI 基线的性能,平均提升 0.78 个百分点。
引用
@article{arxiv.2505.23146,
title = {Cross-Domain Bilingual Lexicon Induction via Pretrained Language Models},
author = {Qiuyu Ding and Zhiqiang Cao and Hailong Cao and Tiejun Zhao},
journal= {arXiv preprint arXiv:2505.23146},
year = {2025}
}