OpenEthics:开源生成式大语言模型的全面伦理评估
计算与语言
2026-01-09 v2
摘要
生成式大语言模型展现出巨大潜力,但也引发了关键的伦理关切,包括安全性、公平性、鲁棒性和可靠性问题。然而,现有的大多数伦理研究受限于其狭窄的关注点、缺乏语言多样性以及对有限模型集的评估。为解决这些不足,我们使用一个评估四个关键伦理维度的新数据集,对 29 个近期开源 LLM 进行了广泛的伦理评估:鲁棒性、可靠性、安全性和公平性。我们的分析包括高资源语言英语和低资源语言土耳其语,提供了全面的评估和更安全模型开发的指南。采用 LLM-as-a-Judge 方法,我们的实验结果表明,许多开源模型在安全性、公平性和鲁棒性方面表现出色,而可靠性仍然是一个关键问题。伦理评估显示出跨语言一致性,并且更大的模型通常表现出更好的伦理性能。我们还表明,越狱模板对本研究中检验的大多数开源模型无效。我们在 https://github.com/metunlp/openethics 上共享所有材料,包括数据和脚本。
引用
@article{arxiv.2505.16036,
title = {OpenEthics: A Comprehensive Ethical Evaluation of Open-Source Generative Large Language Models},
author = {Yıldırım Özen and Burak Erinç Çetin and Kaan Engür and Elif Naz Demiryılmaz and Cagri Toraman},
journal= {arXiv preprint arXiv:2505.16036},
year = {2026}
}