ChiEngMixBench: 评估大语言模型在自发与自然中英混合生成上的表现
计算与语言
2026-01-26 v1 人工智能
摘要
语码混合在人类与大语言模型的互动中日益普遍,然而现有工作常将其简化为翻译或可转换性问题,难以评估模型的切换行为是否语境恰当且符合人类习惯。我们引入了ChiEngMixBench,这是首个旨在评估真实社区语境下语码混合能力的基准,它构建于一个通用的构建流水线之上,支持跨领域和双语对的、可扩展的数据集开发。ChiEngMixBench将语码混合表述为一个认知对齐问题,其特征是两个互补的信号:自发性和自然性。实证评估表明,我们的指标能够系统地区分不同模型的语码混合性能。除基准测试外,我们进一步揭示了一种隐式涌现的术语分层策略,这一现象与矩阵语言框架理论一致,表明多语言大语言模型与人类交流之间存在结构化的认知对齐。
引用
@article{arxiv.2601.16217,
title = {ChiEngMixBench: Evaluating Large Language Models on Spontaneous and Natural Chinese-English Code-Mixed Generation},
author = {Qingyan Yang and Tongxi Wang and Yunsheng Luo},
journal= {arXiv preprint arXiv:2601.16217},
year = {2026}
}