中文

面向大语言模型的风险厌恶微调

人工智能 2025-01-14 v1 计算与语言

摘要

我们考察了缓解大语言模型 (LLM) 在响应特定提示时生成负面或有毒内容的挑战。我们提出了将风险厌恶原则整合到 LLM 微调中,以最小化有害输出的发生,尤其是针对罕见但重要的事件。通过优化条件价值风险 (Conditional Value at Risk, CVaR) 的风险度量,我们的方法在避免有毒输出方面表现出色,同时保持生成任务的有效性。在情感修改和有毒性缓解任务上的经验评估表明,风险厌恶强化学习与人类反馈 (RLHF) 在促进更安全更建设性的线上讨论环境方面具有效用。

关键词

引用

@article{arxiv.2501.06911,
  title  = {Risk-Averse Finetuning of Large Language Models},
  author = {Sapana Chaudhary and Ujwal Dinesha and Dileep Kalathil and Srinivas Shakkottai},
  journal= {arXiv preprint arXiv:2501.06911},
  year   = {2025}
}

备注

Neurips 2024