中文

自我批判引导的好奇心精炼:通过情境学习提升大语言模型的诚实与有用性

计算与语言 2025-06-23 v1

摘要

大语言模型(LLM)在各种自然语言任务中展现出强大的能力,但始终保持诚实和有用的输出仍是一个开放性挑战。为克服这一挑战,本文从两个互补的方向进行了研究。它对十个广泛使用的大语言模型进行了全面的基准评估,包括来自OpenAI、Meta和Google的专有模型和开源权重模型。同时,它提出了一种新颖的提示策略,即自我批判引导的好奇心精炼提示。这种策略的核心思想是使模型能够在无需额外训练的情况下对其响应进行自我批判和精炼。该方法通过引入两个轻量级情境步骤(自我批判步骤和精炼步骤)来扩展好奇心驱动的提示策略。在使用GPT-4o作为诚实性和有用性评判标准评估HONESET数据集上的实验结果显示,所有模型都实现了一致的改进。该方法减少了差质量响应的数量,增加了高质量响应的数量,并在评估模型的H²分数上实现了1.4%至4.3%的相对提升。这些结果凸显了结构化自我精炼作为一种可扩展且无需训练的策略,以提高大语言模型输出可信度的有效性。

关键词

引用

@article{arxiv.2506.16064,
  title  = {Self-Critique-Guided Curiosity Refinement: Enhancing Honesty and Helpfulness in Large Language Models via In-Context Learning},
  author = {Duc Hieu Ho and Chenglin Fan},
  journal= {arXiv preprint arXiv:2506.16064},
  year   = {2025}
}