中文

模型规模、温度与提示风格如何影响LLM与人类评估分数的一致性

计算与语言 2025-09-25 v1 统计方法学

摘要

我们研究了模型规模、温度和提示风格如何影响大语言模型(LLMs)在评估临床推理技能时,其自身内部、模型之间以及与人类评估的一致性。模型规模成为影响LLM与人类评分一致性的关键因素。本研究强调了在多个层面检查一致性的重要性。

关键词

引用

@article{arxiv.2509.19329,
  title  = {How Model Size, Temperature, and Prompt Style Affect LLM-Human Assessment Score Alignment},
  author = {Julie Jung and Max Lu and Sina Chole Benker and Dogus Darici},
  journal= {arXiv preprint arXiv:2509.19329},
  year   = {2025}
}

备注

9 pages, 4 figures, accepted at NCME AIME 2025