评估面向人格引导生成的大语言模型偏见
计算与语言
2024-05-31 v1
摘要
人格引导文本生成任务要求大语言模型(LLM)生成符合特定人格特征分布的文本。人们的人格是多面的,但目前关于 LLM 生成意见偏差的研究仅探索了多选环境或单维人格。我们定义不一致人格为具有多个特征且其中一个特征在人类调查数据中使其他特征概率降低的情形,例如支持增加军费支出的政治自由派。我们发现 LLM 对不一致人格的引导性比一致人格低 9.7%,有时会生成与其人口统计特征相关的 stereotypical 立场而非目标立场。我们评估的模型中,采用强化学习从人类反馈(RLHF)微调的模型更易引导,尤其是对与政治自由派和女性相关的立场,但呈现出显著较少的人格多样性。我们也发现 LLM 的可引导性存在方差,这种方差无法从多选意见评估中预测。我们的结果表明,在开放式文本生成中评估模型的重要性,能够揭示新的 LLM 意见偏见。此外,这种设置还能阐明我们引导模型走向更丰富且更具多样性观点的能力。
引用
@article{arxiv.2405.20253,
title = {Evaluating Large Language Model Biases in Persona-Steered Generation},
author = {Andy Liu and Mona Diab and Daniel Fried},
journal= {arXiv preprint arXiv:2405.20253},
year = {2024}
}
备注
Accepted to Findings of ACL 2024. Code and data available at https://github.com/andyjliu/persona-steered-generation-bias