中文

构建码混合通用依存森林以实现无偏跨语言关系抽取

计算与语言 2023-06-06 v3

摘要

近期跨语言关系抽取(XRE)的研究积极利用通用依存(UD)资源中语言一致的结构特征,但由于语言间不可避免的语言差异,它们可能严重受限于有偏迁移(例如目标偏置或源偏置)。在本工作中,我们通过构建一种码混合 UD 森林来研究基于 UD 的无偏 XRE 迁移。我们首先将源语言句子翻译为平行的目标端语言,并分别对两者解析 UD 树。然后,我们将源端/目标端 UD 结构合并为一个统一的码混合 UD 森林。借助此类森林特征,训练与预测阶段之间基于 UD 的 XRE 差距能够有效缩小。我们在 ACE XRE 基准数据集上开展实验,结果表明所提出的码混合 UD 森林有助于无偏的基于 UD 的 XRE 迁移,并借此实现了显著的 XRE 性能提升。

关键词

引用

@article{arxiv.2305.12258,
  title  = {Constructing Code-mixed Universal Dependency Forest for Unbiased Cross-lingual Relation Extraction},
  author = {Hao Fei and Meishan Zhang and Min Zhang and Tat-Seng Chua},
  journal= {arXiv preprint arXiv:2305.12258},
  year   = {2023}
}