CONFLATOR:为码混语言建模引入基于切换点的旋转位置编码
计算与语言
2023-10-20 v2 机器学习
摘要
两种或多种语言的混合称为码混(CM)。CM 是多语社会中的社会常态。诸如 Transformer 之类的神经语言模型(NLM)已在诸多 NLP 任务上表现有效。然而,面向 CM 的 NLM 仍属未被充分探索的领域。尽管 Transformer 能力强且有力,因其非递归特性,它们并非总能编码位置信息。因此,为丰富词信息并纳入位置信息,定义了位置编码。我们假设切换点(SP),即文本中语言发生切换(L1 -> L2 或 L2 -> L1)的交界处,对 CM 语言模型(LM)构成挑战,因而在建模过程中对 SP 给予特别关注。我们尝试了若干位置编码机制,表明旋转位置编码结合切换点信息可取得最佳结果。我们提出 CONFLATOR:一种面向码混语言的神经语言建模方法。CONFLATOR 试图借助更智能的位置编码,在 unigram 与 bigram 层面学习强调切换点。CONFLATOR 在基于印英码混(Hinglish)的两项任务上超越最先进水平:(i)情感分析与(ii)机器翻译。
引用
@article{arxiv.2309.05270,
title = {CONFLATOR: Incorporating Switching Point based Rotatory Positional Encodings for Code-Mixed Language Modeling},
author = {Mohsin Ali and Kandukuri Sai Teja and Neeharika Gupta and Parth Patwa and Anubhab Chatterjee and Vinija Jain and Aman Chadha and Amitava Das},
journal= {arXiv preprint arXiv:2309.05270},
year = {2023}
}
备注
Workshop on Computational Approaches to Linguistic Code-Switching @EMNLP2023