当推理监督伤害:基于 TTCW 的长篇文学评论生成
计算与语言
2026-05-21 v1
摘要
自动评估长篇文学写作仍具有挑战性,因为通用的 LLM 作为裁判方法可能完全捕捉原创性和灵活性等创造性相关维度。虽然《创意写作测试》(TTCW)提供了结构化的创意框架,且先前工作在两两水平上展示了基于 TTCW 的参考评估,但尚无大规模数据集用于长篇 TTCW 基于文学评论生成。我们通过构建包含 263,911 篇长篇故事的数据集来弥补这一空白,每篇故事均在 14 个 TTCW 基于维度上标注了标量得分和元综合评论意见。使用该数据集,我们在两个规模(4B 和 8B)下进行微调,分别设置有无推理内容的两种条件。结果表明,非推理微调实现了更强大且更稳定的性能,最佳设置的评估得分为 0.6820。进一步分析显示,受推理监督的模型更容易出现解析错误,常因继续生成与所需 14 项指标评论报告无关或重复的推理样式文本而未能完成任务。这些结果表明,对于固定格式的基于评分表的评论生成,推理监督并非直截的有益因素,精确的指标对齐评分仍在特定任务微调后仍具挑战性。
引用
@article{arxiv.2605.20364,
title = {When Reasoning Supervision Hurts: TTCW-Based Long-Form Literary Review Generation},
author = {Jinlong Liu and Mohammed Bahja and Mark Lee},
journal= {arXiv preprint arXiv:2605.20364},
year = {2026}
}
备注
Submit to EMNLP 2026