大语言模型响应中的有意偏置
计算与语言
2023-11-15 v1
摘要
在本研究中,我们有意将偏置引入大语言模型(LLM)的响应中,试图为交互媒体目的创建特定人格。我们探索了 Falcon-7b 等开源模型与 Open AI 的 GPT-4 模型之间的差异,并量化了这两个系统所提供响应的一些差异。我们发现,GPT-4 的专家混合模型配以监督器的护栏,尽管在一般保证 AI 对齐方面有用,但在试图构建具有多种非主流观点的角色时是有害的。本研究旨在为未来大语言模型有意偏置的探索奠定基础,以使这些实践可应用于创意领域与新形式的媒体。
引用
@article{arxiv.2311.07611,
title = {Intentional Biases in LLM Responses},
author = {Nicklaus Badyal and Derek Jacoby and Yvonne Coady},
journal= {arXiv preprint arXiv:2311.07611},
year = {2023}
}