语境足矣:关于散文序列性的经验验证
计算与语言
2025-11-13 v1
摘要
最近的研究提出使用大型语言模型(LLM)通过一种称为序列性的度量来量化叙事流动,该度量结合了主题和语境术语。有人批评称原始结果受主题选择方式的影响,且该度量未经验证。该批评者提出仅使用语境术语作为更具概念有效性和可解释性的替代方案。本文对该方案进行经验验证。我们使用带有人工标注特征分数的两个散文数据集(ASAP++ 和 ELLIPSE),展示语境版本的序列性更 closely 对齐人类对话水平特征如组织和连贯性的评估。虽然零样本提示的 LLM 预测特征分数比语境度量单独使用更准确,但当与标准语言特征结合使用时,语境度量的预测价值大于主题唯一度量和原始序列性度量。值得注意的是,该组合也优于零样本 LLM 预测,凸显了显式建模句子间流动的价值。我们的发现支持将基于语境的序列性作为已验证、可解释且互补的特征,用于自动化作文评分及相关 NLP 任务。
引用
@article{arxiv.2511.09185,
title = {Context is Enough: Empirical Validation of $\textit{Sequentiality}$ on Essays},
author = {Amal Sunny and Advay Gupta and Vishnu Sreekumar},
journal= {arXiv preprint arXiv:2511.09185},
year = {2025}
}
备注
9 pages, 2 figures