中文

通过数据与参数高效强化学习改进中立观点生成

计算与语言 2025-10-09 v2 人工智能 机器学习

摘要

本文表明,参数高效强化学习(PE-RL)是一种极为有效的训练策略,能够提升大型语言模型(LLMs)在敏感话题上以中立观点(NPOV)回答问题的能力,即提供信息更丰富、更多样且更公正的回答。通过评估 PE-RL 及多种强基线方法(包括 LoRA 微调(最强基线)、SFT 和 RLHF),证明了这一点。PE-RL 不仅在整体 NPOV 质量上超越了最强基线(97.06%→99.08%),而且在语言学家认为区分"充分回答"与"优秀回答"的关键特征上得分也高得多(支持性细节的存在率 60.25%→85.21%,过度简化的缺失率 68.74%→91.43%)。定性分析佐证了这一结果。此外,我们的评估还发现了 PE-RL 在此任务上的一个关键特性:与更新所有参数的方法不同,它能够跨主题泛化。最后,为支持进一步研究,我们还发布了数据集 SHQ-NPOV,并提供了通过迭代式人工同行评议和标注者训练来创建此类数据集的方法。

关键词

引用

@article{arxiv.2503.03654,
  title  = {Improving Neutral Point-of-View Generation with Data- and Parameter-Efficient RL},
  author = {Jessica Hoffmann and Christiane Ahlheim and Zac Yu and Aria Walfrand and Jarvis Jin and Marie Tano and Ahmad Beirami and Erin van Liemt and Nithum Thain and Hakim Sidahmed and Lucas Dixon},
  journal= {arXiv preprint arXiv:2503.03654},
  year   = {2025}
}