Flames:面向中文大语言模型价值对齐的评测基准
计算与语言
2024-05-31 v6 人工智能
摘要
大语言模型(LLMs)在各地区的广泛应用迫切要求评估其与人类价值的一致性。然而,当前的评测基准难以有效揭示 LLMs 的安全漏洞。尽管众多模型在这些评测中取得高分并“登顶榜单”,LLMs 在更深层次的人类价值对齐以及实现真正无害性方面仍存在显著差距。为此,本文提出一个名为 Flames 的价值对齐基准,其既涵盖常见的无害性原则,也包含融合和谐等特定中国价值观的独特道德维度。据此,我们精心设计了融合复杂场景与越狱方法、大多具有隐含恶意的对抗性提示。通过提示 17 个主流 LLMs,我们获取模型回复并进行了严格标注以开展细致评估。我们的发现表明,所有受评 LLMs 在 Flames 上表现均相对较差,尤其在安全与公平维度。我们还开发了一个轻量级专用打分器,能够对 LLMs 在多个维度上打分,从而在该基准上高效评估新模型。Flames 的复杂度已远超现有基准,为当代 LLMs 设立了新挑战,并凸显了进一步对齐 LLMs 的必要性。我们的基准已公开于 https://github.com/AIFlames/Flames。
引用
@article{arxiv.2311.06899,
title = {Flames: Benchmarking Value Alignment of LLMs in Chinese},
author = {Kexin Huang and Xiangyang Liu and Qianyu Guo and Tianxiang Sun and Jiawei Sun and Yaru Wang and Zeyang Zhou and Yixu Wang and Yan Teng and Xipeng Qiu and Yingchun Wang and Dahua Lin},
journal= {arXiv preprint arXiv:2311.06899},
year = {2024}
}
备注
Accepted to the NAACL 2024