诚实性对齐
计算与语言
2024-10-29 v2 人工智能
摘要
近期的研究在将大型语言模型(LLM)对齐至有益性与无害性方面取得了显著进展。在本文中,我们论证了对齐至诚实性(honesty)的重要性,以确保 LLM 在缺乏知识时主动拒绝回答问题,同时不过度保守。然而,诚实性对齐的一个关键方面在于识别 LLM 的知识边界,这需要在指标开发、基准构建和训练方法上提供全面的解决方案。我们通过首先建立精确的问题定义,并受《论语》启发定义“诚实性”来应对这些挑战。这作为开发指标的基石,通过量化 LLM 对齐后的进展来有效衡量其诚实性。此外,我们引入了一个灵活的训练框架,该框架由若干高效的微调技术进一步实例化,这些技术强调诚实性而不牺牲在其他任务上的性能。我们广泛的实验表明,这些对齐后的模型在诚实性上表现出显著提升,正如我们提出的指标所示。我们在 \url{https://github.com/GAIR-NLP/alignment-for-honesty} 开源所有相关资源以促进未来研究。
引用
@article{arxiv.2312.07000,
title = {Alignment for Honesty},
author = {Yuqing Yang and Ethan Chern and Xipeng Qiu and Graham Neubig and Pengfei Liu},
journal= {arXiv preprint arXiv:2312.07000},
year = {2024}
}
备注
NeurIPS 2024