思考公平与缓慢:结构化提示对语言模型去偏的有效性
计算与语言
2024-05-20 v1
摘要
现有的去偏技术通常基于训练或需要访问模型内部结构和输出分布,因此对于希望根据特定需求调整大语言模型输出的最终用户来说,这些技术不可及。在本研究中,我们考察了结构化提示技术是否能提供公平文本生成的机会。我们评估了一个全面的、以最终用户为中心的迭代去偏框架,该框架应用系统2思维过程来设计提示,以诱导逻辑性、反思性和批判性的文本生成,包括单一、多步、指令和基于角色的变体。通过系统地在多个数据集和不同提示策略上评估多个大语言模型,我们表明更复杂的基于系统2的隐含提示显著优于其他技术,在输出中表现出更低的平均偏差,同时在下游任务上保持有竞争力的性能。我们的工作为设计以及以最终用户为中心的大语言模型使用评估框架的潜力提供了研究方向。
引用
@article{arxiv.2405.10431,
title = {Thinking Fair and Slow: On the Efficacy of Structured Prompts for Debiasing Language Models},
author = {Shaz Furniturewala and Surgan Jandial and Abhinav Java and Pragyan Banerjee and Simra Shahid and Sumit Bhatia and Kokil Jaidka},
journal= {arXiv preprint arXiv:2405.10431},
year = {2024}
}
备注
The first two authors have equal contribution