中文

Dr Genre:基于解耦 LLM 反馈的强化学习用于通用文本重写

计算与语言 2025-03-11 v1 人工智能 机器学习

摘要

通用文本重写是一种普遍的大型语言模型(LLM)应用,涵盖风格转换、事实纠正和邮件编辑等多种现实任务。这些任务在重写目标上各不相同(例如事实一致性 vs. 语义保持),这使得开发一个在所有维度上均表现优异的统一模型极具挑战性。现有方法通常专门针对单一任务或特定目标,限制了其泛化能力。在本工作中,我们引入了一个精通事实性、风格和对话重写任务的通用模型。为了模拟真实世界的用户重写请求,我们构建了一个对话重写数据集 ChatRewrite,利用 LLM 从原始邮件中生成听起来“自然”的指令。结合其他流行的重写数据集,包括用于事实性重写任务的 LongFact 和用于风格重写任务的 RewriteLM,这构成了一个用于训练和评估通用重写模型的广泛基准。为了与特定任务目标对齐,我们提出了 Dr Genre,一个用于通用重写的解耦奖励学习框架,该框架利用面向目标的奖励模型并进行特定任务加权。评估表明,\approach 在所有目标任务上均提供了更高质量的重写,改进了包括指令遵循(一致性)、内部一致性(连贯性)和最小不必要编辑(简洁性)在内的目标。

关键词

引用

@article{arxiv.2503.06781,
  title  = {Dr Genre: Reinforcement Learning from Decoupled LLM Feedback for Generic Text Rewriting},
  author = {Yufei Li and John Nham and Ganesh Jawahar and Lei Shu and David Uthus and Yun-Hsuan Sung and Chengrun Yang and Itai Rolnick and Yi Qiao and Cong Liu},
  journal= {arXiv preprint arXiv:2503.06781},
  year   = {2025}
}

备注

29 pages, 4 figures, 25 tables