面向大语言模型的风险厌恶微调
人工智能
2025-01-14 v1 计算与语言
摘要
我们考察了缓解大语言模型 (LLM) 在响应特定提示时生成负面或有毒内容的挑战。我们提出了将风险厌恶原则整合到 LLM 微调中,以最小化有害输出的发生,尤其是针对罕见但重要的事件。通过优化条件价值风险 (Conditional Value at Risk, CVaR) 的风险度量,我们的方法在避免有毒输出方面表现出色,同时保持生成任务的有效性。在情感修改和有毒性缓解任务上的经验评估表明,风险厌恶强化学习与人类反馈 (RLHF) 在促进更安全更建设性的线上讨论环境方面具有效用。
引用
@article{arxiv.2501.06911,
title = {Risk-Averse Finetuning of Large Language Models},
author = {Sapana Chaudhary and Ujwal Dinesha and Dileep Kalathil and Srinivas Shakkottai},
journal= {arXiv preprint arXiv:2501.06911},
year = {2025}
}
备注
Neurips 2024