大语言模型中的角色扮演悖论:推理性能提升与伦理困境
计算与语言
2025-02-04 v2
摘要
大语言模型(LLM)中的角色扮演通过模拟多样化的认知视角,增强了其生成上下文相关且高质量回复的能力。然而,我们的研究识别出与该技术相关的重大风险。首先,我们证明自动调优(autotuning)——一种根据问题自动选择模型角色的方法——会导致生成有害输出,即使模型被要求采用中立角色。其次,我们研究了不同角色如何影响生成带有偏见或有害内容的可能性。通过在包含刻板印象和有害问题的基准测试上进行测试,我们发现角色扮演持续放大了偏见输出的风险。我们的结果强调,在敏感或高风险环境中部署 LLM 时,需要仔细考虑角色模拟和调优过程。
引用
@article{arxiv.2409.13979,
title = {Role-Play Paradox in Large Language Models: Reasoning Performance Gains and Ethical Dilemmas},
author = {Jinman Zhao and Zifan Qian and Linbo Cao and Yining Wang and Yitian Ding and Yulan Hu and Zeyu Zhang and Zeyong Jin},
journal= {arXiv preprint arXiv:2409.13979},
year = {2025}
}
备注
9 pages, 7 figures, 3 tables, submitted to CogSci 2025