中文

DualReward:面向填空题干选项生成的动态强化学习框架

计算与语言 2025-07-17 v1

摘要

本文引入DualReward,一种用于自动生成填空题干选项的新型强化学习框架。不同于依赖主要监督学习或静态生成模型的常规方法,我们的方法采用双奖励结构并结合自适应缩放,将人类创建的金标准选项与模型生成的候选选项进行区分。该框架根据模型性能和置信水平动态调整奖励信号的强度。在CLOTH-F和MCQ两个段落级(句子级)填空题数据集上进行评估,结果显示我们的方法在SOTA基线上 consistently取得改进。实验结果表明,自适应奖励缩放机制在同构数据集(CLOTH-F)上提供有限但稳定的收益,而在多样化、跨域数据集(MCQ)上取得更大幅度的改进(在P@1上提升3.48-3.86%),表明其在处理不同题型和领域方面尤为有效。我们的工作提供了一个灵活的框架,有效地平衡了从可靠人类示例中学习的同时探索新型高质量选项的能力,以实现自动化测试生成。

关键词

引用

@article{arxiv.2507.11875,
  title  = {DualReward: A Dynamic Reinforcement Learning Framework for Cloze Tests Distractor Generation},
  author = {Tianyou Huang and Xinglu Chen and Jingshen Zhang and Xinying Qiu and Ruiying Niu},
  journal= {arXiv preprint arXiv:2507.11875},
  year   = {2025}
}

备注

Accepted to CCL 2025