大语言模型可成为强大的自我去宣扬器
密码学与安全
2024-10-08 v1
摘要
减少大语言模型(LLM)生成有害和有毒输出的可能性是对齐 LLM 的关键任务。现有方法主要依赖外部奖励模型(即另一个语言模型)或使用自生成数据进行微调来影响结果。本文表明 LLM 具备无需额外奖励模型或重新训练即可进行自我去宣扬的能力。我们提出了一种轻量级受控解码算法——自律自完美采样(SASA),用于 LLM 的去宣扬。SASA 利用 LLM 的上下文表示来学习 characterize 有毒与非有毒输出的线性子空间。当逐词自动完成响应时,SASA 动态跟踪当前输出的边际,以通过调整自回归采样策略将生成引导 away 于有毒子空间。我们在规模和性质不同的 LLM 上进行评估,包括 Llama-3.1-Instruct(8B)、Llama-2(7B)和 GPT2-L 模型,分别使用 RealToxicityPrompts、BOLD 和 AttaQ 数据集进行测试。SASA 在生成句子质量方面显著优于原始模型,达到与最先进去宣扬技术相当的性能,仅利用 LLM 的内部表示即可显著降低有毒水平。
引用
@article{arxiv.2410.03817,
title = {A novel TLS-based Fingerprinting approach that combines feature expansion and similarity mapping},
author = {Amanda Thomson and Leandros Maglaras and Naghmeh Moradpoor},
journal= {arXiv preprint arXiv:2410.03817},
year = {2024}
}