基于对抗学习的藏汉词汇自监督对齐方法
计算与语言
2021-10-05 v1
摘要
藏语是一种低资源语言。为缓解藏汉平行语料短缺问题,本文利用两个单语语料库和少量种子词典,通过不同嵌入空间中词簇的相似度计算,学习带种子词典的半监督方法及自监督对抗训练方法,并提出一种仅基于藏汉单语数据对齐的改进自监督对抗学习方法。实验结果如下:第一,藏语音节与汉字的实验结果不佳,反映出藏语音节与汉字之间语义关联较弱;第二,先前半监督方法的种子词典在前10个预测词上准确率为66.5(藏-汉)和74.8(汉-藏),而改进的自监督方法在两个语言方向上均达到了53.5的准确率。
引用
@article{arxiv.2110.01258,
title = {A Aelf-supervised Tibetan-chinese Vocabulary Alignment Method Based On Adversarial Learning},
author = {Enshuai Hou and Jie zhu},
journal= {arXiv preprint arXiv:2110.01258},
year = {2021}
}
备注
8pages,2nd International Conference on Machine Learning Techniques and NLP (MLNLP 2021)