中文

从土耳其视角评估离线大语言模型能力:没有危险的提问

计算与语言 2026-03-12 v1 人工智能 密码学与安全 机器学习

摘要

将大语言模型(LLM)集成到教育进程中,尤其是在土耳其 heritage language 教育这一教学脆弱情境中,引入了数据隐私和可靠性方面的重大限制。本研究旨在系统评估在土耳其 heritage language 教育语境下,可本地部署的离线LLM的韧性和教育安全性。为此,开发了土耳其异常套件(Turkish Anomaly Suite, TAS),包含10个原创边缘情景,用于评估模型在认知抵抗、逻辑一致性和教育安全方面的能力。对14个参数范围从2.7亿至32亿的模型进行实验,结果显示异常抵抗能力不仅取决于模型规模,sycophancy偏差即使在大型模型中也可能构成教育风险。研究结果表明,参数规模在8B至14B之间的推理导向模型,在成本与安全性之间 represents the most balanced的区间,适用于语言学习者。

关键词

引用

@article{arxiv.2603.09996,
  title  = {There Are No Silly Questions: Evaluation of Offline LLM Capabilities from a Turkish Perspective},
  author = {Edibe Yilmaz and Kahraman Kostas},
  journal= {arXiv preprint arXiv:2603.09996},
  year   = {2026}
}

备注

5 pages, 6 tables, conference