小型语言模型的创意写作点燃:LLM 评判家 versus 多智能体精炼奖励
计算与语言
2025-09-01 v1 人工智能
摘要
大型语言模型(LLMs)已展现出惊人的创意写作能力,但其巨大的计算需求阻碍了广泛应用。增强小型语言模型(SLMs)提供了可行的替代方案,但当前方法如监督微调(SFT)在新颖性方面难题,且强化学习来自人类反馈(RLHF)成本高昂。本文探索了在强化学习来自 AI 反馈(RLAIF)框架中,两种不同 AI 驱动的奖励策略,用于点燃 7B 参数的 SLM进行创意写作,具体针对中文祝福语生成。第一策略采用基于 novel 多智能体拒绝抽样框架训练的偏好数据 RM。第二种更具创新性的策略利用 principle-guided LLM-as-a-Judge,其奖励函数通过包含反思机制的对抗训练方案进行优化,直接提供奖励信号。全面实验结果表明,两种方法均显著提升创意输出,超出基线水平;而 principle-guided LLM-as-a-Judge demonstrably 产生成果质量更佳。此外,它在训练效率和减少对人工标注数据的依赖方面具有显著优势,为面向创意 SLMs 的更可扩展和更有效的方法之路。我们的自动化评估方法还与人类判断高度一致。我们的代码和数据已公开于 https://github.com/weixiaolong94-hub/Igniting-Creative-Writing-in-Small-Language-Models。
引用
@article{arxiv.2508.21476,
title = {Igniting Creative Writing in Small Language Models: LLM-as-a-Judge versus Multi-Agent Refined Rewards},
author = {Xiaolong Wei and Bo Lu and Xingyu Zhang and Zhejun Zhao and Dongdong Shen and Long Xia and Dawei Yin},
journal= {arXiv preprint arXiv:2508.21476},
year = {2025}
}
备注
EMNLP 2025 Main