不在此地也不在彼处:多语言编码器中代码混合文本的跨语言表征动力学
计算与语言
2026-03-23 v1
摘要
尽管多语言编码器基于语言模型在代码混合分析任务中被广泛采用,但我们对它们如何在内部表示代码混合输入,以及这些表示是否与被混合的各个语言构成有意义的联系却知之甚少。以印地语-英语为案例研究,我们构建了一个包含平行英语、印地语(梵文)和罗马数字化代码混合句子的统一三语言语料库,并通过 CKA、token 级别的显著性分析和熵基不确定性分析探测标准多语言编码器及其代码混合适应变体之间的跨语言表征对齐。我们发现,尽管标准模型对英语和印地语对齐良好,但代码混合输入仍与任一语言松散地连接——继续在代码混合数据上预训练可提升英语-代码混合对齐,但以牺牲英语-印地语对齐为代价。解释性分析进一步揭示了明显的非对称性:模型通过英语主导语义子空间处理代码混合文本,而本机脚本印地语提供补充信号以减少表征不确定性。鼓励这些发现,我们引入一种三语言后训练对齐目标,使代码混合表征同时更接近两个构成语言,从而实现更平衡的跨语言对齐,并在情感分析和仇恨言论检测中获得下游性能提升——表明,将代码混合表征锚定在其构成语言中对跨语言理解具有意义的帮助。
引用
@article{arxiv.2603.19771,
title = {Neither Here Nor There: Cross-Lingual Representation Dynamics of Code-Mixed Text in Multilingual Encoders},
author = {Debajyoti Mazumder and Divyansh Pathak and Prashant Kodali and Jasabanta Patro},
journal= {arXiv preprint arXiv:2603.19771},
year = {2026}
}
备注
24 pages