评估中文大语言模型:人格分配对刻板印象和防护机制的影响
计算机与社会
2026-05-28 v2
摘要
近期研究指出,为大语言模型(LLM)分配特定人格可以显著增加有害内容的生成。然而,针对非西方语境、特别是基于中文的LLM中人格驱动的毒性问题,关注有限。在本文中,我们对四种中文LLM进行了大规模跨模型分析,研究了拒绝行为与人格驱动的毒性放大,利用超过140万条生成文本的综合数据集。我们识别出人格驱动拒绝行为中的显著差异,包括在评估的中文LLM中触发拒绝的系统性性别差异。此外,我们提供了人格驱动毒性放大相对于模型默认基线的定量证据。我们表明,这种放大——其幅度在不同模型间差异显著——是由多个因素的交互驱动的,涉及人格条件化、提示策略、目标社会群体和模型特定的安全机制。利用模型特定的回归分析,我们系统地刻画了人格类别、目标社会群体和提示模板如何独立且联合地塑造拒绝行为和输出毒性。作为补充案例研究,我们进一步探索了一种基于外部LLM评估器反馈的迭代式评估引导缓解策略,证明高度有毒的输出可以在不进行昂贵模型重新训练的情况下大幅减少。总体而言,我们的研究结果强调了针对中文LLM进行文化语境化安全评估的重要性,并为评估LLM生成内容中人格诱导风险和探索性缓解策略提供了一个结构化框架。
引用
@article{arxiv.2506.04975,
title = {Evaluating Chinese Large Language Models: The Influence of Persona Assignment on Stereotypes and Safeguards},
author = {Geng Liu and Li Feng and Carlo Alberto Bono and Songbo Yang and Mengxiao Zhu and Francesco Pierri},
journal= {arXiv preprint arXiv:2506.04975},
year = {2026}
}