SAGE:基于本体论的层次化LLM文学评估框架
计算与语言
2026-05-11 v1
摘要
文学质量评估需要评估诸如文化表征、情感深度、哲学深度等解释性维度,这些维度难以直接进行计算测量。我们提出SAGE(Hierarchical LLM-Based Literary Evaluation),一种分解为本体论支撑的解释性维度,并通过结构化大语言模型评估实现的层次化评估框架,采用多轮迭代反思和独立验证。我们在100篇短篇小说(50篇经典作品,30篇普罗米斯小说,20篇LLM生成叙事)上进行验证,覆盖三个分析层次(文化、情感-心理学、存在-哲学),采用双模式评估。在600次评估中,框架实现98.8%的得分收敛,超过94%的评审间一致性,并在基于内容的评估与基于元数据的评估之间实现近乎完美的模式不变性。统计分析揭示,经典作品 > 普罗米斯 > LLM 存在一致的体裁等级(所有p<0.001),各层次具有特定的判别特征:文化批评和哲学深度显示出非常大的效应量(Cohen's d>2.4),而情感表征的差距较小(d=1.68),这表明情感模式比批判态度或哲学深度更易从训练数据中学习。跨层次相关性(r=0.649-0.683)确认这三个维度捕获了经验上可区分的质量特征。这一发现表明,理论驱动的LLM评估能够实现测量级可靠性,并支持系统性识别当前生成模型在人类文学生产方面的不足,其对开放式文本生成的可扩展自动评估具有直接意义。
引用
@article{arxiv.2605.07102,
title = {SAGE: Hierarchical LLM-Based Literary Evaluation through Ontology-Grounded Interpretive Dimensions},
author = {Tianyu Wang and Nianjun Zhou},
journal= {arXiv preprint arXiv:2605.07102},
year = {2026}
}
备注
19 pages, 4 figures