她有一双钴蓝色的眼睛:以提示测试构建对齐且可持续的语言模型
计算与语言
2023-12-18 v3 人工智能
摘要
随着大语言模型(LLMs)在社会中的使用增加,其被滥用的风险也随之上升。必须配备适当的防护措施,以确保 LLM 输出维护社会的伦理标准,凸显人工智能技术可发挥的积极作用。近期事件表明常规训练的 LLM 存在伦理隐患,导致整体不安全的用户体验。这引出了我们的研究问题:如何确保 LLM 对齐?本工作中,我们引入一套独特提示测试集,以促进开发公平、安全且鲁棒的对齐 LLM。我们表明,在开发流程的每一步(包括数据整理、预训练和微调)对 LLM 进行提示,将产生整体上更负责任的模型。我们的测试集评估了四种最先进语言模型——GPT-3.5、GPT-4、OPT 和 LLaMA-2——的输出。本文给出的评估凸显了社会对齐与当前 LLM 能力之间的差距。此外,采用如我们这样的测试集可降低使模型安全且公平的环境开销。
引用
@article{arxiv.2310.18333,
title = {She had Cobalt Blue Eyes: Prompt Testing to Create Aligned and Sustainable Language Models},
author = {Veronica Chatrath and Oluwanifemi Bamgbose and Shaina Raza},
journal= {arXiv preprint arXiv:2310.18333},
year = {2023}
}
备注
Accepted as Oral at the AAAI 2nd Workshop on Sustainable AI