语言多样性奇特的衰退:在合成文本上训练语言模型
计算与语言
2024-04-17 v2
摘要
本研究探讨了在其前身生成的合成数据上训练语言模型的后果,鉴于强大生成模型的突出地位,这一做法正日益普遍。与通常关注性能指标不同,我们聚焦于该训练方法对语言多样性的影响,尤其在随时间递归进行时对语言多样性的影响。为评估这一点,我们改编并开发了一组针对词汇、句法与语义多样性的新指标,将其应用于英语中多种自然语言生成任务的递归微调实验。我们的发现揭示了模型输出多样性在连续迭代中持续下降,对于要求高度创造力的任务尤为显著。这一趋势凸显了在合成文本上训练语言模型的潜在风险,特别是在语言丰富性保持方面。我们的研究强调需要审慎考量此类训练方法对语言模型语言能力的长期影响。
引用
@article{arxiv.2311.09807,
title = {The Curious Decline of Linguistic Diversity: Training Language Models on Synthetic Text},
author = {Yanzhu Guo and Guokan Shang and Michalis Vazirgiannis and Chloé Clavel},
journal= {arXiv preprint arXiv:2311.09807},
year = {2024}
}
备注
Accepted to NAACL 2024 Findings