通过强化学习教会大语言模型像人类一样编辑不当论证
计算与语言
2026-04-15 v1
摘要
编辑人类撰写的文本已成为大语言模型(LLM)的标准用例,例如,使一个人的论点更适合讨论。然而,比较人类与LLM生成的编辑,我们观察到编辑策略上的不匹配:LLM通常执行多个分散的编辑,并倾向于显著改变含义,而人类则更倾向于将相关更改封装在自包含、保留原意的编辑中。在本文中,我们提出了一种强化学习方法,教会LLM进行类人编辑,以提高论点的适当性。我们的方法生成自包含的句子级编辑建议,这些建议可以独立地被接受或拒绝。我们使用组相对策略优化(Group Relative Policy Optimization)和一种多组件奖励函数来训练该方法,该函数联合优化了编辑级别的语义相似性、流畅性和模式一致性,以及论点级别的适当性。在自动评估和人工评估中,它在类人编辑方面优于竞争基线和现有技术水平,多轮编辑达到了接近完全重写的适当性。
引用
@article{arxiv.2604.12770,
title = {Teaching LLMs Human-Like Editing of Inappropriate Argumentation via Reinforcement Learning},
author = {Timon Ziegenbein and Maja Stahl and Henning Wachsmuth},
journal= {arXiv preprint arXiv:2604.12770},
year = {2026}
}