中文

分词与否:跨语言迁移中文本表示的比较研究

计算与语言 2023-10-13 v1 机器学习

摘要

选择合适的分词方案常常是低资源跨语言迁移的瓶颈。为理解文本表示选择带来的下游影响,我们对具有多样文本表示模态的语言模型进行比较分析,包括 2 个基于分词的模型(\texttt{BERT}、\texttt{mBERT})、1 个基于图像的模型(\texttt{PIXEL})和 1 个字符级模型(\texttt{CANINE})。首先,我们提出一种评分语言商数(Language Quotient, LQ)指标,能够加权综合零样本与少样本评估。利用该指标,我们在三项任务(词性标注、依存句法分析和命名实体识别)上开展了涵盖 19 种源语言与 133 种目标语言的实验。我们的分析显示,当语言亲缘关系近且共享视觉相似文字时,基于图像的模型在跨语言迁移中表现优异;然而,对于偏向词义的任务(词性标注、命名实体识别),基于分词的模型更胜一筹。此外,在词关系起关键作用的依存句法分析任务中,聚焦字符级的模型优于其他模型。最后,我们基于发现提出一种推荐方案,以根据任务与语言需求指导模型选择。

关键词

引用

@article{arxiv.2310.08078,
  title  = {To token or not to token: A Comparative Study of Text Representations for Cross-Lingual Transfer},
  author = {Md Mushfiqur Rahman and Fardin Ahsan Sakib and Fahim Faisal and Antonios Anastasopoulos},
  journal= {arXiv preprint arXiv:2310.08078},
  year   = {2023}
}

备注

Accepted at 3RD MULTILINGUAL REPRESENTATION LEARNING (MRL) WORKSHOP, 2023