HSKBenchmark:通过课程调谐构建大型语言模型中文第二语言习得的基准
计算与语言
2025-11-20 v1 人工智能
摘要
语言习得是揭示人类语言智能本质且最近成为提高大型语言模型(LLM)可解释性的有前景视角。然而,控制人类学习者输入的实验在伦理和实际操作上不可行,这给语言习得建模的可验证性和可扩展性带来了挑战,尤其是中文第二语言习得(SLA)。虽然LLM提供了可控且可重复的替代方案,但尚缺乏支持阶段性建模和评估的系统基准。本文提出HSKBenchmark,作为LLM在中文SLA中进行阶段性建模和写作评估的第一个基准。其覆盖HSK 3至6级,包含676万字的真实教材、1.6万个人工合成指令样本、30个测试主题以及以语言学为基础的评估体系。为模拟人类学习轨迹,我们引入课程调谐框架,从初级到高级水平训练模型。创建一个评估体系来检查基于水平的语法覆盖、写作错误、词汇和句法复杂度以及整体评分。我们还构建HSKAgent,在1万个学习者作品上进行微调。大量实验结果表明,HSKBenchmark不仅有效建模了中文SLA,而且作为LLM动态写作评估的可靠基准。我们的微调LLM在写作性能上与高级人类学习者持平,并表现出人类习得特征。HSKBenchmark、HSKAgent及其检查点作为基础工具和资源,为未来研究在语言习得建模和LLM可解释性方面铺平了道路。代码和数据公开于https://github.com/CharlesYang030/HSKB。
引用
@article{arxiv.2511.15574,
title = {HSKBenchmark: Modeling and Benchmarking Chinese Second Language Acquisition in Large Language Models through Curriculum Tuning},
author = {Qihao Yang and Xuelin Wang and Jiale Chen and Xuelian Dong and Yuxin Hao and Tianyong Hao},
journal= {arXiv preprint arXiv:2511.15574},
year = {2025}
}
备注
Accepted by AAAI-2026