语义损失引导的数据高效监督微调以实现 LLM 的安全响应
计算与语言
2024-12-12 v2 人工智能
摘要
大语言模型(LLMs)对有毒提示生成不安全响应是其应用中的一个重要问题。虽然已有多种努力旨在解决这一安全问题,但先前的方法通常需要大量人工数据收集,或依赖于使用另一个 LLM 生成校正数据这一不太可靠的选项。本文旨在解决这一问题,并克服对大量高质量人工数据的依赖。我们的方法仅需少量来自不安全 LLM 本身的不安全响应即可。通过结合语义代价与负地球移动距离(EMD)损失,我们引导 LLM 远离生成不安全响应。此外,我们提出了 EMD 损失的一个新颖下界,使优化更加高效。实验结果表明,我们的方法在性能和数据效率方面优于基线方法,并进一步考察了过度对齐的细微影响以及使用对比数据时语言能力的潜在退化。
引用
@article{arxiv.2412.06843,
title = {Semantic Loss Guided Data Efficient Supervised Fine Tuning for Safe Responses in LLMs},
author = {Yuxiao Lu and Arunesh Sinha and Pradeep Varakantham},
journal= {arXiv preprint arXiv:2412.06843},
year = {2024}
}