评估主权 LLM 的社会文化对齐性与技术安全性
计算与语言
2025-10-17 v1
摘要
近期趋势表明,越来越多地关注如何使用和应用主权大语言模型(sovereign LLMs)。关于主权 LLM 的全球讨论凸显了政府开发自身 LLM 以适应其独特社会文化和历史背景的需求。然而,目前仍缺乏用于检验两个关键问题的框架和数据集:(1) 这些模型如何与用户的社会文化背景对齐,(2) 它们在维持安全性和技术鲁棒性方面是否能避免暴露用户于潜在风险之中。为此,我们构建了一个新数据集,并引入了一个用于提取和评估主权 LLM 社会文化元素的分析框架,同时进行技术鲁棒性评估。我们的实验结果表明,尽管主权 LLM 在支持低资源语言方面发挥着有意义的作用,但它们并不总是满足“这些模型能良好服务于其目标用户”这一流行说法。我们还展示,追求这一未经检验的说法可能导致低估关键质量属性,如安全性。我们的研究表明,推进主权 LLM 的发展需要更广泛的评估,这种评估包含更全面且切实可行的评估标准。
引用
@article{arxiv.2510.14565,
title = {Assessing Socio-Cultural Alignment and Technical Safety of Sovereign LLMs},
author = {Kyubyung Chae and Gihoon Kim and Gyuseong Lee and Taesup Kim and Jaejin Lee and Heejin Kim},
journal= {arXiv preprint arXiv:2510.14565},
year = {2025}
}