KRISTEVA:将细读作为评估解释推理的新任务
计算与语言
2025-06-04 v2
摘要
每年都有数百万篇论文在大学水平的英语课程中被撰写和评分。学生被要求通过一种称为细读(close reading)的过程,对文学和文化文本进行分析,即收集文本细节以构建基于证据的论点。尽管细读被视为批判性思维的基础,并且被广泛采纳为大学课程的必修要素,但细读从未在大型语言模型(LLM)上进行评估,多学科基准(如 MMLU)也不包括文学作为科目。为填补这一空白,我们提出 KRISTEVA,第一个用于评估解释推理的细读基准,由 1331 个多选题构成,这些题目来源于课堂数据。通过 KRISTEVA,我们提出三个逐步增加难度的任务集合,以近似细读过程的不同元素,我们用于测试 LLM 是否能够理解和推理关于文学作品的问题:1)提取风格特征,2)从参数化知识中检索相关上下文信息,3)在风格与外部上下文之间进行多跳推理。我们的基线结果发现,虽然最先进的 LLM 具备一定的大学水平细读能力(准确率 49.7% - 69.7%),但其性能在我们 11 个任务中的 10 个任务上仍落后于有经验的人类评估者。
引用
@article{arxiv.2505.09825,
title = {KRISTEVA: Close Reading as a Novel Task for Benchmarking Interpretive Reasoning},
author = {Peiqi Sui and Juan Diego Rodriguez and Philippe Laban and Dean Murphy and Joseph P. Dexter and Richard Jean So and Samuel Baker and Pramit Chaudhuri},
journal= {arXiv preprint arXiv:2505.09825},
year = {2025}
}
备注
ACL 2025 main