BERT 用于单语与跨语言反向词典
计算与语言
2020-10-01 v1
摘要
反向词典的任务是根据给定的词语描述找出恰当的目标词。在本文中,我们尝试将 BERT 引入该任务。然而,由于 BERT 基于字节对编码(BPE)子词编码,让 BERT 根据描述生成词语并非易事。我们提出了一种简单而有效的方法,使 BERT 能为该特定任务生成目标词。此外,跨语言反向词典的任务是找出由另一种语言描述所恰当对应的目标词。此前的模型须维持两种不同的词嵌入并学习对齐这些嵌入。然而,通过使用多语言 BERT(mBERT),我们可用单一子词嵌入高效完成跨语言反向词典,且无需进行语言间对齐。更重要的是,mBERT 即便在没有平行语料库的情况下也能取得出色的跨语言反向词典性能,这意味着它仅需相应的单语数据即可完成跨语言反向词典。代码已公开于 https://github.com/yhcc/BertForRD.git。
引用
@article{arxiv.2009.14790,
title = {BERT for Monolingual and Cross-Lingual Reverse Dictionary},
author = {Hang Yan and Xiaonan Li and Xipeng Qiu},
journal= {arXiv preprint arXiv:2009.14790},
year = {2020}
}
备注
Accepted as EMNLP 2020 Findings