中文

HonestLLM:迈向诚实且有用的大型语言模型

计算与语言 2024-12-12 v3 人工智能

摘要

大型语言模型(LLM)因其卓越的生成能力在各行各业取得了显著成功。然而,为了安全有效的实际部署,确保诚实和有用性至关重要。本文探讨一个问题:我们能否在保持LLM诚实的同时优先考虑其有用性?首先,我们建立了旨在保证LLM诚实的详尽原则。此外,我们引入了一个名为HoneSet的新数据集,包含精心设计的930个查询,涵盖六个类别,用于评估LLM保持诚实的能力。随后,我们提出了两种增强LLM诚实性和有用性的方法:无训练增强和基于微调的改进。无训练方法基于好奇心驱动的提示,使LLM能够表达对查询的内部困惑和不确定性,从而优化其响应。相反,基于微调的方法采用受课程学习启发的两阶段过程:首先指导LLM区分诚实和不诚实的响应,然后优化训练以增强有用性。在九个著名LLM上进行的实验表明,通过实施我们提出的增强方法,所有模型在诚实性方面均有显著提升。尤其值得注意的是,根据H²(诚实且有用)评估,Llama3-8b提升了65.3%,Mistral-7b提升了124.7%。我们相信,我们的工作可以为开发更值得信赖的LLM用于实际应用铺平道路。

关键词

引用

@article{arxiv.2406.00380,
  title  = {HonestLLM: Toward an Honest and Helpful Large Language Model},
  author = {Chujie Gao and Siyuan Wu and Yue Huang and Dongping Chen and Qihui Zhang and Zhengyan Fu and Yao Wan and Lichao Sun and Xiangliang Zhang},
  journal= {arXiv preprint arXiv:2406.00380},
  year   = {2024}
}