使用GPT-4衡量与修改英文文本的可读性
计算与语言
2024-10-21 v1
摘要
大型语言模型(LLMs)在其他领域的成功提升了LLMs能否可靠地评估和操控文本可读性的问题。我们以经验方式回应这个问题。首先,我们使用一套4724篇英文文本摘录的公开语料库,发现从GPT-4 Turbo和GPT-4o mini中“零样本”生成的可读性估计与人类判断之间呈现较高的相关性(分别为r = 0.76和r = 0.74),优于来自传统可读性公式和各种心理语言学指数的估计。然后,我们进行一次预先登记的人类实验(N = 59),询问Turbo是否能够可靠地使文本更易读或更难读。我们发现有证据支持这一假设,尽管人类判断方差仍然未被解释。我们随后讨论了这种方法的局限性,包括范围受限的问题,以及“可读性”概念的有效性以及其对上下文、受众和目标的依赖性。
引用
@article{arxiv.2410.14028,
title = {Measuring and Modifying the Readability of English Texts with GPT-4},
author = {Sean Trott and Pamela D. Rivière},
journal= {arXiv preprint arXiv:2410.14028},
year = {2024}
}
备注
9 pages, 6 figures, workshop TSAR 2024