生成文本中的语法模板检测与度量
计算与语言
2024-10-08 v2
摘要
最近的工作聚焦于评估大语言模型 (LLM) 生成文本的多样性,主要关注词汇水平特征。本文从语法特征入手,刻画模型中普遍重复的语法结构。具体而言,我们定义语法模板,表明模型在下游任务中产生模板化文本的比例高于人类参考文本所见的比例(后者仅为 35%)。我们发现,大多数(76%)模型生成的模板可在预训练数据中找到(相较于人类撰写文本的 35%),且在如 RLHF 等微调过程中的训练数据未被覆盖。这种与预训练数据之间的关联,使我们能够在缺乏预训练数据时分析语法模板。我们还发现,模板作为特征能够区分不同模型、任务和领域,对常规模型构造进行定性评估具有实用价值。最后,我们展示了将模板作为分析大语言模型训练数据风格记忆的有用工具。
引用
@article{arxiv.2407.00211,
title = {Detection and Measurement of Syntactic Templates in Generated Text},
author = {Chantal Shaib and Yanai Elazar and Junyi Jessy Li and Byron C. Wallace},
journal= {arXiv preprint arXiv:2407.00211},
year = {2024}
}
备注
EMNLP 2024