面向多特质论文评分的特质感知策略优化
计算与语言
2026-05-27 v2
摘要
多特质论文评分旨在提供对写作质量在多个维度上的细粒度评估。然而,如何有效后训练自回归评分模型仍未得到充分探索。本文提出特质感知策略优化(TAPO),一种专为自回归多特质评分设计的后训练框架。我们的方法在样本维度和特质维度上对奖励进行分解,结合全局评分一致性、特质层次准确性、格式有效性以及特质间依赖性保持。在此基础上,我们通过纳入原始提示文本和特质描述来增强训练中的提示,为特质特定的得分生成提供更丰富的语义信息。实验表明,我们的方法在多个主干模型上均显著优于监督微调和标量奖励优化基准,显示示了特质感知后训练在论文评分中的有效性和可迁�性。
引用
@article{arxiv.2605.25731,
title = {Trait-Aware Policy Optimization for Autoregressive Multi-Trait Essay Scoring},
author = {Zhengyang Wang and Sanwoo Lee and Jiaxin Wang and Chenxi Miao and Weikang Li and Yunfang Wu},
journal= {arXiv preprint arXiv:2605.25731},
year = {2026}
}