说不之艺:语言模型中的情境化不从容
计算与语言
2024-11-25 v2 人工智能
人机交互
摘要
聊天式语言模型被设计为具有帮助性,但不应遵从用户的每一条请求。虽然大多数现有研究主要关注对“不安全”查询的拒绝,但我们认为,不从容的范围应进一步拓展。我们引入了一套完整的情境化不从容分类体系,描述模型何时以及如何不应遵从用户请求。该分类体系涵盖广泛的类别,包括不完整、不被支持、不可确定以及人性化请求(除不安全请求外)。为测试语言模型的不从容能力,我们利用该分类体系开发了包含 1000 条不从容提示的新评估套件。我们发现,大多数现有模型在某些此前少见的类别中显示出显著高的从容率,其中包括 GPT-4 在最多 30% 的请求中错误地从容。为弥补这些差距,我们探索了不同的训练策略,使用合成生成的请求和预期不从容响应的训练集。我们的实验表明,虽然直接对指令调优模型进行微调可能导致过度拒绝以及一般能力的下降,但使用参数高效方法如低秩适配器有助于在适当的不从容与其他能力之间取得良好平衡。
引用
@article{arxiv.2407.12043,
title = {The Art of Saying No: Contextual Noncompliance in Language Models},
author = {Faeze Brahman and Sachin Kumar and Vidhisha Balachandran and Pradeep Dasigi and Valentina Pyatkin and Abhilasha Ravichander and Sarah Wiegreffe and Nouha Dziri and Khyathi Chandu and Jack Hessel and Yulia Tsvetkov and Noah A. Smith and Yejin Choi and Hannaneh Hajishirzi},
journal= {arXiv preprint arXiv:2407.12043},
year = {2024}
}
备注
The first two authors are co-first authors; Accepted at NeurIPS 2024 Track on Datasets and Benchmarks