通过合成自然语言推理评估大语言模型的多语言与语码切换对齐能力
计算与语言
2025-08-21 v1 人工智能
摘要
大语言模型(LLMs)越来越多地应用于多语言环境,但其跨语言保持一致性、逻辑扎实的对齐能力仍未得到充分探索。我们提出了一个用于多语言自然语言推理(NLI)的受控评估框架,该框架生成合成的、基于逻辑的前提-假设对,并将其翻译成一组类型多样的语言。这种设计能够精确控制语义关系,并允许在单语和混合语言(语码切换)条件下进行测试。令人惊讶的是,语码切换并不会降低性能,甚至可能提升性能,这表明翻译引起的词汇变异可能作为一种正则化信号。我们通过基于嵌入的相似性分析和跨语言对齐可视化验证了语义保真度,确认了翻译对的忠实性。我们的发现揭示了当前大语言模型跨语言推理的潜力和脆弱性,并指出语码切换是提高多语言鲁棒性的一个有前景的杠杆。代码可在 https://github.com/KurbanIntelligenceLab/nli-stress-testing 获取。
引用
@article{arxiv.2508.14735,
title = {Evaluating Multilingual and Code-Switched Alignment in LLMs via Synthetic Natural Language Inference},
author = {Samir Abdaljalil and Erchin Serpedin and Khalid Qaraqe and Hasan Kurban},
journal= {arXiv preprint arXiv:2508.14735},
year = {2025}
}
备注
Under review