中文

论语言模型中自我纠正与信任的交叉

机器学习 2023-11-07 v1

摘要

大语言模型(LLMs)在执行复杂认知任务方面已展现出非凡能力。然而,其复杂性与缺乏透明性引发了若干可信度担忧,包括错误信息与有害内容的传播。近期研究探索了 LLMs 的自我纠正能力以提升其性能。在本工作中,我们探究这些自我纠正能力是否可被利用来改善 LLMs 的可信度。我们开展了聚焦于可信度两个关键方面——真实性与无害性——的实验。我们的发现表明,自我纠正可带来无害性与真实性上的改进,但改进程度因具体的可信度方面和任务性质而异。有趣的是,我们的研究还揭示了 LLMs 在自我纠正过程中出现的“自我怀疑”实例,带来了一组有待解决的新挑战。

关键词

引用

@article{arxiv.2311.02801,
  title  = {On the Intersection of Self-Correction and Trust in Language Models},
  author = {Satyapriya Krishna},
  journal= {arXiv preprint arXiv:2311.02801},
  year   = {2023}
}

备注

Working Paper