中文

RECSIP: 通过重复聚类评分提高LLM精度

计算与语言 2025-03-18 v1 人工智能

摘要

关于大型语言模型(LLM)的最新研究表明自然语言处理(NLP)领域取得了显著进展。然而,尽管取得了这一进步,这些模型仍然缺乏可靠性。这是由于LLM的随机架构所致,这对用户试图确定模型响应的可靠性构成了挑战。这些响应可能在高风险环境中造成严重危害,或在工业环境中导致昂贵的故障。因此,我们提出了REpeated Clustering of Scores Improving the Precision(RECSIP)框架,该框架通过并行询问多个模型、对它们的响应进行评分和聚类,以提高响应的可靠性。我们对参考实现recsip在MMLU-Pro基准上的评估,使用GPT-4o、Claude和Gemini模型,与最佳使用模型相比总体提高了5.8个百分点。

关键词

引用

@article{arxiv.2503.12108,
  title  = {RECSIP: REpeated Clustering of Scores Improving the Precision},
  author = {André Schamschurko and Nenad Petrovic and Alois Christian Knoll},
  journal= {arXiv preprint arXiv:2503.12108},
  year   = {2025}
}

备注

Conference paper accepted for IntelliSys2025