PerMix-RLVR:在可验证奖励对齐下保持人格表达性
计算与语言
2026-04-13 v1 人工智能
摘要
人格提示(persona prompting)已被广泛采用用于引导大语言模型(LLM)的行为并通过分配特定角色来提高其指令性能。然而,确定最佳人格耗时且其对输出质量的影响仍不完全了解。先前的工作主要是在提示层面通过推理时策略来解决此问题,导致额外的计算开销。在本工作中,我们通过在训练阶段解决人格灵敏度问题来避免推理时提示搜索,旨在训练能够适应不同人格而又保持任务性能的模型。具体而言,我们发现基于可验证奖励的强化学习(RLVR)系统性地降低了对人格提示的灵敏度,但也揭示了以结果为导向优化的内在权衡:虽然RLVR在可验证目标的任务上提高了鲁棒性,但在需要时(例如角色扮演)也会降低人格表达性。为此,我们提出了PerMix-RLVR,一种人格混合RLVR策略,用于缓解人格鲁棒性与忠实性之间的权衡,既保留了对有害人格变体的强鲁棒性,又能在需要时实现可靠的人格采纳。具体而言,PerMix-RLVR在MATH500上的人格稳定性得分(PSS)相较于RLVR提升了+21.2%,在PersonaGym上人格忠实性提升了+11.4%。
关键词
引用
@article{arxiv.2604.08986,
title = {PerMix-RLVR: Preserving Persona Expressivity under Verifiable-Reward Alignment},
author = {Jihwan Oh and Soowon Oh and Murad Aghazada and Minchan Jeong and Sungnyun Kim and Se-Young Yun},
journal= {arXiv preprint arXiv:2604.08986},
year = {2026}
}
备注
Preprint