中文

修改大型语言模型后训练以实现多样化创意写作

计算与语言 2025-03-24 v1 机器学习

摘要

由于创意写作任务没有唯一正确答案,经过训练的大型语言模型 (LLM) 应能够生成多样化的有效输出。然而,LLM 后训练通常侧重于提高生成质量,却忽略了促进输出多样性。因此,我们在创意写作生成中探讨后训练方法以促进输出的多样性和质量。我们的核心思想是将偏差——即与给定提示下的所有其他样本相比,训练样本的差异程度——纳入训练目标,以促进从稀有的高质量实例中学习。通过采用我们的 approach 应用于 direct preference optimization (DPO) 和 odds ratio preference optimization (ORPO),我们展示了可以在最小降低质量的同时促进训练模型的输出多样性。我们最好的 8B 参数模型在多样性方面可实现与人类创建的数据集相当的水平,而在输出质量方面则与我们检查过的最佳 instruction-tuned 模型(如 GPT-4o 和 DeepSeek-R1)相当。我们进一步通过人类评估、消除实验和与现有多样化方法 DivPO 的比较来验证我们的 method。

关键词

引用

@article{arxiv.2503.17126,
  title  = {Modifying Large Language Model Post-Training for Diverse Creative Writing},
  author = {John Joon Young Chung and Vishakh Padmakumar and Melissa Roemmele and Yuqian Sun and Max Kreminski},
  journal= {arXiv preprint arXiv:2503.17126},
  year   = {2025}
}