中文

读者即是评估标准:文本特征与读者档案解释AI创意写作的评估冲突

计算与语言 2025-06-05 v1 人机交互

摘要

近期比较AI生成与人类撰写文学文本的研究结果呈现出相互冲突:一些研究表明AI已超越人类水平,而另一些研究则认为AI仍不足。我们从假设开始,即这种差异主要可由读者对文学文本的解释与价值观之间的真实差异所致,而非文本本身的内在质量所致。我们利用五个公开数据集(1471篇短篇故事,101名注释者包括评论家、学生和普通读者),我们(i)提取了17项无参考文本特征(如连贯性、情感波动、平均句长等);(ii)建模个体读者偏好,推导出反映其文本优先事项的特征重要性向量;(iii)在共享的“偏好空间”中分析这些向量。读者向量聚类为两种档案:'表层关注者'(主要为非专家),他们优先考虑可读性和文本丰富性;'整体关注者'(主要为专家),他们重视主题发展、修辞多样性和情感动态。我们的定量结果解释了如何文本特征与每个读者偏好的对齐程度决定了对文学质量的测量结果。这些发现主张在创意文本生成领域采用以读者为导向的评估框架。

关键词

引用

@article{arxiv.2506.03310,
  title  = {The Reader is the Metric: How Textual Features and Reader Profiles Explain Conflicting Evaluations of AI Creative Writing},
  author = {Guillermo Marco and Julio Gonzalo and Víctor Fresno},
  journal= {arXiv preprint arXiv:2506.03310},
  year   = {2025}
}

备注

Camera-ready version, 14 pages, 3 figures. Accepted to Findings of the Association for Computational Linguistics (ACL) 2025. Code & data: https://github.com/grmarco/the-reader-is-the-metric