中文

N-Critics:基于评论者集成的大语言模型自精炼方法

计算与语言 2023-11-09 v2 人工智能 机器学习

摘要

我们提出一种用于大语言模型(LLM)的自校正机制,以缓解毒性与事实幻觉等问题。该方法通过评论者集成以及模型自身的反馈来精炼模型输出。受人类行为启发,我们探究 LLM 能否模拟人类在自我反思并征求他人意见以精炼对复杂主题理解时所表现出的自校正过程。我们的方法独立于具体模型,可跨多个领域应用,通过处理公平性、偏见和鲁棒性问题来提升可信度。我们一致观察到 LLM 在降低毒性和纠正事实错误方面的性能提升。

关键词

引用

@article{arxiv.2310.18679,
  title  = {N-Critics: Self-Refinement of Large Language Models with Ensemble of Critics},
  author = {Sajad Mousavi and Ricardo Luna Gutiérrez and Desik Rengarajan and Vineet Gundecha and Ashwin Ramesh Babu and Avisek Naug and Antonio Guillen and Soumyendu Sarkar},
  journal= {arXiv preprint arXiv:2310.18679},
  year   = {2023}
}