PERSA:基于强化学习的教授风格个人化反馈生成
人工智能
2026-05-05 v1
摘要
大型语言模型 (LLM) 可在教育环境中提供自动化反馈,但将 LLM 的风格与特定教师的语气保持诊断正确性方面仍具挑战。我们思考如何在不牺牲核心知识的前提下,更新 LLM 以生成编程反馈,使其符合教师的grading voice。我们研究如何通过人类反馈强化学习 (RLHF) 适配基于Transformer的 LLM,以匹配教授评分的语气。我们提出 PERSA,一种结合对教授演示进行监督微调、来自两两偏好关系的奖励建模以及近端策略优化 (PPO) 的 RLHF 流程,同时刻意限制学习仅针对承载风格的组件。受Transformer内部分析启发,PERSA 应用参数高效微调。它仅更新顶层Transformer块及其前馈投影,最小化全局参数漂移,同时增加风格可控性。我们在三个代码反馈基准测试 (APPS、PyFiXV 和 CodeReviewQA) 上评估所提出的方法,使用风格对齐和忠实性的互补指标。对于 Llama-3 和 Gemma-2 两套 backbone,PERSA 实现了最强的教授风格迁移,同时保持正确性,例如在 APPS 上,Style Alignment Score (SAC) 提升至 96.2%(相对于 Base 的 34.8%),在 Llama-3 和 Gemma-2 上 Correctness Accuracy (CA) 达到 100%。总体而言,PERSA 为通过对齐内容正确性以及关键的如何说(以教师式语气和结构)提供了实用路径,以实现个人化教育反馈。
引用
@article{arxiv.2605.01123,
title = {PERSA: Reinforcement Learning for Professor-Style Personalized Feedback with LLMs},
author = {Ravi Ranjan and Utkarsh Grover and Xiaomin Lin and Agoritsa Polyzou},
journal= {arXiv preprint arXiv:2605.01123},
year = {2026}
}
备注
18 pages, 6 figures, 7 tables, accepted to conference ACL-2026, BEA