中文

用于生成半结构化解释的奖励工程

计算与语言 2024-01-25 v2

摘要

半结构化解释以显式表示刻画推理者的隐式过程。该解释突出了在特定查询中如何利用可用信息,并辅以推理者从其内部权重中生成的信息,以得出答案。尽管语言模型的生成能力近期有所提升,但生成结构化解释以验证模型真正的推理能力仍具挑战。对于并非很大的语言模型(如 FLAN-T5-XXL)而言,此问题尤为突出。在本工作中,我们首先强调了监督微调(SFT)在应对该挑战时的局限性,随后引入一种精心设计的强化学习(RL)奖励工程方法以更好地解决该问题。我们研究了多种奖励聚合方法,并提供了详细讨论,揭示了 RL 在未来研究中的可观潜力。我们所提方法在两个半结构化解释生成基准(ExplaGraph 和 COPA-SSE)上取得了新的 SOTA 结果。

关键词

引用

@article{arxiv.2309.08347,
  title  = {Reward Engineering for Generating Semi-structured Explanation},
  author = {Jiuzhou Han and Wray Buntine and Ehsan Shareghi},
  journal= {arXiv preprint arXiv:2309.08347},
  year   = {2024}
}

备注

Accepted to EACL2024; code is available at https://github.com/Jiuzhouh/Reward-Engineering-for-Generating-SEG