从土耳其视角评估离线大语言模型能力:没有危险的提问
计算与语言
2026-03-12 v1 人工智能
密码学与安全
机器学习
摘要
将大语言模型(LLM)集成到教育进程中,尤其是在土耳其 heritage language 教育这一教学脆弱情境中,引入了数据隐私和可靠性方面的重大限制。本研究旨在系统评估在土耳其 heritage language 教育语境下,可本地部署的离线LLM的韧性和教育安全性。为此,开发了土耳其异常套件(Turkish Anomaly Suite, TAS),包含10个原创边缘情景,用于评估模型在认知抵抗、逻辑一致性和教育安全方面的能力。对14个参数范围从2.7亿至32亿的模型进行实验,结果显示异常抵抗能力不仅取决于模型规模,sycophancy偏差即使在大型模型中也可能构成教育风险。研究结果表明,参数规模在8B至14B之间的推理导向模型,在成本与安全性之间 represents the most balanced的区间,适用于语言学习者。
引用
@article{arxiv.2603.09996,
title = {There Are No Silly Questions: Evaluation of Offline LLM Capabilities from a Turkish Perspective},
author = {Edibe Yilmaz and Kahraman Kostas},
journal= {arXiv preprint arXiv:2603.09996},
year = {2026}
}
备注
5 pages, 6 tables, conference