通过可控大型语言模型实现安全性与有用性平衡的响应
计算与语言
2024-04-02 v1 人工智能
摘要
随着大型语言模型(LLM)如今变得易于获取,安全性与有用性之间的权衡会显著影响用户体验。优先考虑安全性的模型会让用户感到参与度和帮助性降低,而优先考虑有用性则可能造成伤害。可能的伤害包括教人如何制造炸弹、让青少年接触不当内容以及损害用户心理健康。在这项工作中,我们提出通过控制LLM中的两个属性来平衡不同用例中的安全性和有用性。我们探索了无需训练和微调的方法,这些方法不需要额外的人工标注,并分析了控制LLM中安全性和有用性的挑战。我们的实验表明,我们的方法可以回滚已学习的模型并解锁其可控性。
引用
@article{arxiv.2404.01295,
title = {Towards Safety and Helpfulness Balanced Responses via Controllable Large Language Models},
author = {Yi-Lin Tuan and Xilun Chen and Eric Michael Smith and Louis Martin and Soumya Batra and Asli Celikyilmaz and William Yang Wang and Daniel M. Bikel},
journal= {arXiv preprint arXiv:2404.01295},
year = {2024}
}