中文

基于强化学习的自回归多特征论文评分:引入评分感知多奖励

计算与语言 2024-09-27 v1 人工智能

摘要

自动化作文评分(AES)的最新进展正逐渐转向对多个特征进行评估,以提供更丰富的反馈。类似于典型的AES系统,多特征AES系统采用二次加权kappa值(QWK)来衡量与人类评分员的一致性,这与评分方案密切相关;然而,其非可微性质阻碍了其直接用于神经网络训练。在本文中,我们提出了一种称为Scoring-aware Multi-reward Reinforcement Learning(评分感知多奖励强化学习,简称SaMRL)的方法,通过设计基于QWK的奖励函数并加入均方误差惩罚项,用于多特征AES系统。现有AES领域的强化学习应用仅限于分类模型,尽管存在性能下降问题,因为强化学习需要概率分布;相反,我们采用自回归评分生成框架,利用token生成概率进行稳健的多特征评分预测。实证分析表明,SaMRL有助于模型训练,显著提升了对此前劣势题目的评分能力。

关键词

引用

@article{arxiv.2409.17472,
  title  = {Autoregressive Multi-trait Essay Scoring via Reinforcement Learning with Scoring-aware Multiple Rewards},
  author = {Heejin Do and Sangwon Ryu and Gary Geunbae Lee},
  journal= {arXiv preprint arXiv:2409.17472},
  year   = {2024}
}

备注

EMNLP 2024