基于好奇心驱动的 LLM 评判器:用于个性化创意判断
计算与语言
2025-10-08 v1 机器学习
摘要
现代大型语言模型 (LLM) 在评估数学推理和事实准确性等客观任务方面表现出色,但在面对评估创意时这种主观性强的任务时则表现不足。本文提出了一种基于好奇心驱动的 LLM 评判器,用于评估创意写作,该评判器针对每个人的创意判断进行个性化定制。我们采用 Chakrabarty 等人 (2024) 引入的 Torrance Test of Creative Thinking (TTCW) 基准,该基准包含了由专家人类标注的故事,涵盖诸如原创性等多个主观维度。我们展示了该方法使各种规模的模型能够学习不同个体的细腻创意判断,通过在各种评估指标(如皮尔逊相关系数、Cohen's Kappa 和 F1 值)上相较于基线监督微调 (SFT) 方法实现改进。该方法在标注者之间意见不一致的主观评估场景中尤为有用。
引用
@article{arxiv.2510.05135,
title = {Curiosity-Driven LLM-as-a-judge for Personalized Creative Judgment},
author = {Vanya Bannihatti Kumar and Divyanshu Goyal and Akhil Eppa and Neel Bhandari},
journal= {arXiv preprint arXiv:2510.05135},
year = {2025}
}