中文

BeHonest:衡量大型语言模型诚实性的基准

计算与语言 2024-07-10 v3 人工智能

摘要

以往针对大型语言模型(LLM)的工作主要关注其帮助fulness或harmlessness。然而,诚实性作为另一项关键对齐准则,获得的关注力相对较少。LLM中的不诚实行为,如散布虚假信息和欺骗用户, presents严重风险,这些风险随着这些模型接近超智能水平而加剧。增强LLM的诚实性可解决其关键局限性,帮助发现那些不易表达的潜在能力。这一点凸显了迫切需要可靠的方法和基准来有效确保和评估LLM诚实性的紧迫性。本文介绍BeHonest,一个专为全面评估LLM诚实性而设计的开创性基准。BeHonest评估LLM诚实性的三个关键方面:知识边界意识、规避欺骗以及响应一致性。基于此基础,我们设计了10个场景,用于评估和分析市场上9个流行的LLM,包括来自不同模型家族、不同模型规模的闭源和开源模型。我们的发现表明,LLM的诚实性仍有很大的提升空间。我们鼓励AI社区优先考虑这些模型的诚实性对齐,这可以发挥其全部潜力为社会带来利益,同时防止它们通过欺骗或不一致性造成伤害。我们的基准和代码可在 \url{https://github.com/GAIR-NLP/BeHonest} 找到。

关键词

引用

@article{arxiv.2406.13261,
  title  = {BeHonest: Benchmarking Honesty in Large Language Models},
  author = {Steffi Chern and Zhulin Hu and Yuqing Yang and Ethan Chern and Yuan Guo and Jiahe Jin and Binjie Wang and Pengfei Liu},
  journal= {arXiv preprint arXiv:2406.13261},
  year   = {2024}
}