CoKe:通过关键词链化可定制的细粒度故事评估
计算与语言
2025-03-24 v1
摘要
使用语言模型评估人类撰写的创意文本始终是一个具有挑战性的任务——由于多位标注员评分的主观性。为模拟人类的思考过程,链式思维(CoT)生成自由文本解释,有助于引导模型的预测,而自一致性(SC)则对多个生成的解释进行预测平均。在本研究中,我们发现广泛使用的自一致性推理方法由于目标不匹配——即生成'表面流畅'的解释与实际引导对故事某个方面的评级预测不符——导致次优结果。为克服这一挑战,我们提出了一种基于关键词链化的方法,即在生成自由文本论证之前生成一系列关键词,这些关键词指导我们的评估语言模型进行评级预测。然后,我们生成多样化的关键词集合,并聚合这些生成对应的评分。在StoryER数据集上,基于我们微调的评估模型的CoKe方法不仅达到了人类水平的性能,并且显著优于GPT-4,在与人类标注员的相关性上提升了2倍,还大幅减少了所需的模型参数数量。
引用
@article{arxiv.2503.17136,
title = {CoKe: Customizable Fine-Grained Story Evaluation via Chain-of-Keyword Rationalization},
author = {Brihi Joshi and Sriram Venkatapathy and Mohit Bansal and Nanyun Peng and Haw-Shiuan Chang},
journal= {arXiv preprint arXiv:2503.17136},
year = {2025}
}