面向营销内容审核的多阶段工作流程:基于推理型大语言模型
计算与语言
2026-01-13 v1 人工智能
摘要
推理型大语言模型(LLM)在解决复杂问题方面展现出巨大的潜力。本文提出并评估了一种多阶段工作流程,利用精调后的推理型 LLM 的能力,辅助营销内容的审核过程,确保其符合给定的要求列表。本文的贡献包括:(i)我们提出了一种 novel 方法——不依赖任何外部知识表示——用于自动识别文本内容中的合规问题;(ii)比较不同精调策略(如监督式精调(SFT)和群体相对策略优化(GRPO))在训练解决此问题的模型方面的有效性;(iii)评估了小型 LLM 在生成推理 token 后再提供最终响应的效果;(iv)评估了不同奖励函数的选择与组合对使用 GRPO 训练的模型性能的影响。
引用
@article{arxiv.2601.06054,
title = {A Multi-Stage Workflow for the Review of Marketing Content with Reasoning Large Language Models},
author = {Alberto Purpura and Emily Chen and Swapnil Shinde},
journal= {arXiv preprint arXiv:2601.06054},
year = {2026}
}