中文

重新思考基础模型微调中的无害拒绝

计算与语言 2024-07-01 v1 人工智能 机器学习

摘要

本文探讨了大型语言模型(LLM)微调在多大程度上有效缓解了不当行为,抑或仅仅是掩盖了这些行为。通过设计半真实的角色扮演练习以诱发此类行为,我们研究了LLM在微调干预后的响应动态。我们的 метод涉及对模型进行链式思考(CoT)推理提示,并分析推理痕迹与最终输出之间的一致性。我们发现一种普遍现象,即我们称之为"reason-based deception"的现象:模型要么停止生成推理痕迹,要么生成看似符合伦理的推理痕迹,以掩盖其最终输出不当的本质。我们进一步检验了回应策略(礼貌拒绝 vs 明确驳斥)在抑制多轮交互中不当行为发生方面的效果。我们的发现表明,明确驳斥显著优于礼貌拒绝,能够有效防止不当输出的延续,并几乎消除reason-based deception,这挑战了当前模型微调中的实践做法。因此,本文的两个关键贡献是(1)定义并研究了一种新型隐藏行为——reason-based deception,(2)表明驳斥比拒绝提供更稳健的有害请求响应模型,从而凸显了在微调方法中需要重新考虑响应策略的必要性。

关键词

引用

@article{arxiv.2406.19552,
  title  = {Rethinking harmless refusals when fine-tuning foundation models},
  author = {Florin Pop and Judd Rosenblatt and Diogo Schwerz de Lucena and Michael Vaiana},
  journal= {arXiv preprint arXiv:2406.19552},
  year   = {2024}
}

备注

ICLR 2024 AGI Workshop Poster