中文

WSPAlign:基于大规模弱监督跨度预测的词对齐预训练

计算与语言 2023-10-20 v2

摘要

大多数现有词对齐方法依赖人工对齐数据集或平行语料库,这限制了其实用性。在此,为减轻对人工数据的依赖,我们通过放宽对正确、完全对齐且平行的句子的要求,拓宽了监督来源。具体而言,我们构造含噪声、部分对齐且非平行的段落。随后我们使用如此大规模弱监督数据集,通过跨度预测进行词对齐预训练。各种设置下的广泛实验实证表明,我们提出的方法 WSPAlign 是一种无需人工数据即可预训练词对齐器的有效且可扩展的途径。在标准基准上微调时,WSPAlign 以 F1 提升 3.3~6.1 点、AER 提升 1.5~6.1 点超越了最佳监督基线,确立了新的 SOTA。此外,WSPAlign 在少样本、零样本和跨语言测试中也相较相应基线取得了有竞争力的性能,这表明 WSPAlign 比现有方法对低资源语言更具实用性潜力。

关键词

引用

@article{arxiv.2306.05644,
  title  = {WSPAlign: Word Alignment Pre-training via Large-Scale Weakly Supervised Span Prediction},
  author = {Qiyu Wu and Masaaki Nagata and Yoshimasa Tsuruoka},
  journal= {arXiv preprint arXiv:2306.05644},
  year   = {2023}
}

备注

ACL 2023 main conference long paper